日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
シーン構築arXiv:2608.30821v1

Lucida: 合成可能な実世界からシミュレーションへのシーン構築のための解析・生成・配置

Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling

シェア:XThreadsFacebookLINEはてブBluesky

実室内シーンを編集可能なオブジェクト資産として復元するパイプラインを提案し、各ステップが実際の観測で確実に得られる情報のみを消費するよう再設計。VLMポリシーによるGUI操作でオブジェクト配置を閉ループで行う。

詳しい要約

1. どんなもの?

Lucidaは、実世界の屋内シーンを、編集可能なオブジェクト資産として配置された完全なシーンとして復元するcomposable scene modelingのためのパイプラインである。ビデオ入力から、各インスタンスのマルチビュー証拠を持つシーングラフを構築し、各インスタンスの完全なアセットを生成し、VLMポリシーを用いて配置する。

2. 先行研究と比べてどこがすごい?

既存のパイプラインは、parse、generate、placeの3ステップに分解するが、各ステップが正確なインスタンス形状、遮蔽のないビュー、観測に正確に一致するアセットなど、実際の乱雑なキャプチャでは得られない入力を前提としている。Lucidaはこの順序を維持しつつ、各ステップが実際のキャプチャで確実に得られる情報のみを消費し、パイプラインの最後に精度を集中させることで、この前提を再分配している。

3. 技術・手法の肝は?

Lucidaは、ビデオをシーングラフにパースし、各ノードがインスタンスごとのマルチビュー証拠を持つ。次に、各インスタンスの証拠から完全なアセットを生成する。配置にはGizmoActというVLMポリシーを使用し、配置をマルチターンGUI操作として捉え、オブジェクトのgizmoを閉ループで操作し、アライメントが達成されたと判断した時点で停止する。

4. どうやって有効だと検証した?

シーンレベルの3Dオブジェクト検出、オブジェクトのポーズ推定、シーン再構成のタスクで評価した。R2S-SceneでBoxerに対してmAPを69%改善し、CA-1MでADD-SB@0.05を57.8%から83.4%に向上させ、シーンF-ScoreをSAM3Dの0.794から0.924に改善した。

5. 議論はある?

要旨からは、Lucidaの限界や議論についての詳細は不明である。ただし、パイプラインの各ステップが実際のキャプチャの不完全さに対処する設計であることから、特に遮蔽やノイズの多い環境でのロバスト性が議論の対象となる可能性がある。

6. 次に読むべき論文は?

要旨で参照されている研究は、Boxer、SAM3D、R2S-Scene、CA-1Mである。次に読むべき論文としては、これらの手法の詳細を述べた論文が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Minghan Qin, Yuang Wang, Xiuyu Yang, Yushi Long, Yujian Zhang, Ruihuan Wang, Kai Ye, Yangang Zhang, Hang Li

分類: cs.CV, cs.AI

原文アブストラクト

Composable scene modeling aims to recover a real indoor scene as complete, editable object assets arranged as observed, giving robot simulation and embodied AI a simulation-ready replica of the real environment whose objects can be manipulated individually. Existing pipelines decompose the task into three steps---parse the observations into instances, generate an asset for each, and place each asset back---but every step presumes an input that a cluttered capture rarely provides: accurate instance geometry, unoccluded views, and assets that accurately match the observations. We propose Lucida, which keeps this order but redistributes the requirements, so each step consumes only what a real capture reliably provides and precision is reached at the end of the pipeline rather than demanded at its start. Lucida parses the video into a scene graph whose nodes carry per-instance multi-view evidence, generates a complete asset for each instance from its evidence, and places assets with GizmoAct, a VLM policy that casts placement as multi-turn GUI interaction, manipulating the object's gizmo in a closed loop and deciding itself when alignment is reached. Across scene-level 3D object detection, object pose estimation, and scene reconstruction, Lucida improves mAP over Boxer by 69% on R2S-Scene, raises ADD-SB@0.05 from 57.8% to 83.4% on CA-1M, and increases scene F-Score from 0.794 for SAM3D to 0.924.