日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マニピュレーションarXiv:2609.24995

不確実性下でのマルチモーダル指示グラウンディングによるマニピュレーション計画

MIGU: Multimodal Instruction Grounding under Uncertainty for Manipulation Planning

シェア:XThreadsFacebookLINEはてブBluesky

言語とジェスチャーの不確実な手がかりを統合し、VLMの意味情報と3D幾何学的尤度をベイズ的に融合して対象物体を推定、必要に応じて確認質問も行うマニピュレーション計画フレームワークMIGUを提案した。

詳しい要約

1. どんなもの?

- 人間の指示理解を目的としたロボットのマルチモーダル指示グラウンディングの研究 - 言語とジェスチャーを相補的だが不確実な手がかりとして扱う - MIGU というモジュール型フレームワークを提案 - 意味的証拠と幾何学的証拠を統合した grounding belief を構築 - それを manipulation planning に接続する - 実世界ベンチマークで評価

2. 先行研究と比べてどこがすごい?

- 評価したすべての baseline を実世界ベンチマークで上回る - 明示的なマルチモーダル不確実性モデリングの利点を ablation が支持 - 言語とジェスチャーの不確実性を統合的に扱う点が特徴 - 先行研究との具体的な差異は要旨からは不明

3. 技術・手法の肝は?

- 視方向と depth の不確実性を eye-finger geometry に伝播し 3D geometric likelihood を構築 - hand-direction 推定誤差も考慮 - VLM が候補物体・領域に対する semantic prior を提供 - Bayes-inspired fusion で幾何尤度と意味事前を統合 - 得られた belief に基づき直接 planning か clarification 要求かを behavior planning で判断 - grounded target が mobile manipulation と tabletop task-and-motion planning の goal を定義

4. どうやって有効だと検証した?

- 実世界ベンチマークで評価 - MIGU が評価したすべての baseline を上回る - ablation により明示的なマルチモーダル不確実性モデリングの利点を支持 - 具体的なデータセット名・指標・被験者数は要旨からは不明

5. 議論はある?

- 明示的なマルチモーダル不確実性モデリングの有効性を ablation が支持 - 不確実性に基づき clarification を要求する行動計画の利点に言及 - 限界・失敗事例・計算コストなどの議論は要旨からは不明

6. 次に読むべき論文は?

- 要旨で参照・比較されている個別研究は明示されていない - 関連手法として VLM を用いた instruction grounding - eye-finger geometry に基づく 3D 幾何推定 - Bayes-inspired fusion によるマルチモーダル統合 - task-and-motion planning および mobile manipulation の planning 研究

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Mingke Lu, Anxing Xiao, David Hsu

分類: cs.RO

原文アブストラクト

Understanding natural human instructions is crucial for deploying robots in human-centric environments. We study multimodal instruction grounding, where language and gesture provide complementary but uncertain cues. We present MIGU, a modular framework that combines semantic and geometric evidence into a unified grounding belief and connects it to manipulation planning. MIGU constructs a 3D geometric likelihood by propagating viewing-direction and depth uncertainty through eye-finger geometry while accounting for hand-direction estimation error. A vision-language model (VLM) provides semantic priors over candidate objects and regions, which are combined with the geometric likelihood through Bayes-inspired fusion. The resulting belief supports behavior planning to either proceed directly to downstream planning or request clarification. Grounded targets then define goals for mobile manipulation and tabletop task-and-motion planning. On a real-world benchmark, MIGU outperforms all evaluated baselines, while ablations support the benefit of explicit multimodal uncertainty modeling. Project website: multimodal-instruction.github.io

関連論文

PR本紙発行元 EmplifAI