日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
シーングラフarXiv:2609.00619v1

DSG: 変化する屋内環境における身体化エージェントのための動的3Dシーングラフ構築

DSG: Dynamic 3D Scene Graph Construction for Embodied Agents in Changing Indoor Environments

シェア:XThreadsFacebookLINEはてブBluesky

物体の移動を検出し空間関係を推論することで、動的な屋内環境でも最新の3Dシーングラフを構築するフレームワークを提案した。

詳しい要約

1. どんなもの?

DSGは、屋内環境で物体の位置が頻繁に変化する動的な状況に対応するため、3Dシーングラフを動的に構築・更新するフレームワークを提案する。具体的には、物体の変化を検出し、空間関係の推論を行う。セマンティック対応の3D Gaussianシーン表現を構築し、デュアルビュー描画に基づく物体変化検出法を開発してシーングラフのノード更新を可能にする。また、多粒度の視覚的文脈を統合した空間関係推論法を提案し、大規模言語モデルを用いてより豊富な物体間空間関係を識別する。さらに、動的屋内環境での評価のためのベンチマークDynTHORをAI2-THORシミュレーションプラットフォーム上に導入する。

2. 先行研究と比べてどこがすごい?

従来のシーングラフ構築手法は静的な環境を前提としており、物体の移動や変化に対応できない。DSGは、動的な環境変化を明示的に扱い、物体変化の検出と空間関係の再推論を統合することで、シーングラフを最新の状態に保つ。また、既存のベンチマークは静的環境向けであり、動的環境での評価が不足していたが、DynTHORを新たに提供することでこのギャップを埋める。

3. 技術・手法の肝は?

手法の核は、(1)セマンティック対応の3D Gaussianシーン表現を用いて、物体の変化を検出するためのデュアルビュー描画ベースの手法を開発した点。(2)空間関係推論において、多粒度の視覚的文脈(例えば、局所的な物体特徴と大域的なシーンコンテキスト)を大規模言語モデルに入力し、より多様な空間関係(例:'on', 'near', 'inside'など)を識別する点。

4. どうやって有効だと検証した?

DynTHOR、3RScan、および実世界のシーンを用いて広範な実験を実施。物体ノード構築と空間関係推論の両方で、既存手法を一貫して上回る性能を示し、動的シーングラフ構築の精度を大幅に向上させた。

5. 議論はある?

要旨からは、提案手法の限界や潜在的な問題についての議論は不明。ただし、動的環境でのシーングラフ更新は計算コストや誤検出の影響を受ける可能性が考えられるが、詳細は要旨に記載されていない。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、AI2-THORシミュレーションプラットフォーム、3RScanデータセット、および3D Gaussianシーン表現に関する研究が挙げられる。また、大規模言語モデルを用いた空間関係推論の関連研究も参考になる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Ming Liao, Chao Ye, Jianing Fei, Weiyang Lin

分類: cs.RO

原文アブストラクト

In indoor environments, object positions frequently change due to human activities or embodied-agent interactions, causing previously constructed scene graphs to become inconsistent with the current scene. To address this issue, we propose DSG, a dynamic 3D scene graph construction framework that detects object changes and performs spatial relationship reasoning. First, we construct a semantic-aware 3D Gaussian scene representation and develop a dual-view rendering-based object change detection method to enable reliable scene graph node updates. Second, we propose a spatial relationship reasoning method that incorporates multi-granularity visual context, enabling a large language model to identify a richer set of interobject spatial relationships. Furthermore, we introduce DynTHOR, a dynamic indoor scene graph benchmark built on the AI2-THOR simulation platform for evaluating scene graph construction in dynamic environments. Extensive experiments on Dyn-THOR, 3RScan, and real-world scenes demonstrate that DSG consistently outperforms existing methods in both object node construction and spatial relationship reasoning, significantly improving the accuracy of dynamic scene graph construction.

関連論文