日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
3Dシーン理解arXiv:2608.17535

GroupForward: インスタンスグループ化フィードフォワードガウシアンスプラッティングによる参照可能な3Dシーン構築

GroupForward: Building Referable 3D Scenes via Instance-Grouped Feed-Forward Gaussian Splatting

シェア:XThreadsFacebookLINEはてブBluesky

疎な多視点画像から3Dシーンの幾何・外観・インスタンス構造・意味を同時に再構成するフィードフォワード型の3Dガウシアンスプラッティングモデルを提案し、インスタンスグループ化により参照表現による複雑なシーン推論を可能にした。

詳しい要約

1. どんなもの?

GroupForwardは、疎な多視点画像から3Dシーンの幾何・外観・インスタンス構造・意味を同時再構成するフィードフォワード型のインスタンスグループ化3D Gaussian Splatting (3DGS)モデル。さらに、複雑な3D参照分割のためのReferential Scene Reasoning Framework (RSRF)を提案し、インスタンスグループ化された3Dシーングラフ上で視覚言語モデルを用いて参照表現の対象インスタンスを推論する。

2. 先行研究と比べてどこがすごい?

既存のフィードフォワード型セマンティック3DGSは、各Gaussianに高次元のセマンティック特徴を付与し、カテゴリやフレーズベースのクエリに限定され、明示的なインスタンス識別が欠如していた。GroupForwardは、コンパクトなインスタンス埋め込みを学習してGaussianをクロスビュー一貫した3Dインスタンスにグループ化し、セマンティック特徴のレンダリングをインスタンスレベルの集約と伝播に置き換える点で革新的。さらに、単純なセマンティッククエリから複雑な参照推論へ言語インタラクションを拡張した。

3. 技術・手法の肝は?

手法の核は、各Gaussianに高次元セマンティック特徴を付与する代わりに、コンパクトなインスタンス埋め込みを学習し、Gaussianをクロスビュー一貫した3Dインスタンスにグループ化すること。これにより、フィードフォワード型セマンティック3DGSを、Gaussian単位のセマンティック特徴レンダリングから、インスタンス単位のセマンティック集約と伝播へと再構成する。さらに、RSRFはインスタンスグループ化された3Dシーングラフを構築し、参照表現に対して候補インスタンスを検索し、視覚言語モデルが構造化されたインスタンス証拠と多視点観測に基づいて推論する。

4. どうやって有効だと検証した?

セマンティック再構成と参照推論の実験により、インスタンスグループ化された再構成と推論フレームワークの有効性を実証した。具体的なデータセットや比較手法は要旨からは不明。

5. 議論はある?

要旨からは、提案手法の限界や議論点は明示されていない。ただし、フィードフォワード型であるため、入力視点の数や配置に制約がある可能性や、インスタンスグループ化の精度が参照推論の性能に影響する可能性が考えられるが、要旨からは不明。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、フィードフォワード型セマンティック3DGSの既存手法(例:セマンティック特徴をGaussianに付与する手法)や、3D参照分割のための視覚言語モデルを用いた手法が挙げられる。具体的な論文名は要旨にないため、同分野の定番として、3Dシーン理解のためのフィードフォワード再構成手法や、3D視覚言語ナビゲーション・参照分割に関する研究を読むとよい。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Qijian Tian, Zimeng Wu, Xuhong Wang, Lizhuang Ma, Xin Tan

分類: cs.CV

原文アブストラクト

Simultaneously reconstructing and understanding 3D environments is essential for embodied agents. Toward this goal, feed-forward semantic 3D Gaussian Splatting (3DGS) efficiently constructs semantic scene representations from sparse multi-view observations. However, existing methods lack explicit instance discrimination and mainly support category- or phrase-based semantic queries. To this end, we propose GroupForward, an instance-grouped feed-forward Gaussian splatting model that reconstructs geometry, appearance, instance structure, and semantics from sparse, unposed, and uncalibrated multi-view images. Unlike existing methods that attach high-dimensional semantic features to each Gaussian, GroupForward learns compact instance embeddings that group Gaussians into cross-view consistent 3D instances, reformulating feed-forward semantic 3DGS from per-Gaussian semantic feature rendering to instance-level semantic aggregation and propagation. Building on these instance groups, we further propose a Referential Scene Reasoning Framework (RSRF) for complex 3D referring segmentation. RSRF constructs an instance-grouped 3D scene graph and retrieves candidate instances for a given referring expression. A vision-language model then reasons over structured instance evidence and multi-view observations to identify the referred instance among the candidates. RSRF thereby extends language interaction from simple semantic querying to complex referential scene reasoning. Experiments on semantic reconstruction and referential reasoning demonstrate the effectiveness of our instance-grouped reconstruction and reasoning framework.

関連論文