日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マニピュレーションarXiv:2608.29379v1

制約付きLLMによる意味と物理の橋渡し:安全で信頼できるロボットマニピュレーション

Bridging Semantics and Physics with Constrained LLMs for Safe and Trustworthy Robotic Manipulation

シェア:XThreadsFacebookLINEはてブBluesky

言語指示から生成されたプランが物理的に実行可能かを検証するため、型付き契約とMCPスキーマ検証、MoveIt Task Constructorによる衝突チェックを組み合わせ、実機で高い成功率を達成した。

詳しい要約

1. どんなもの?

本論文は、LLMを用いた言語指示によるロボット操作において、言語的に妥当なプランが物理的に実行不可能な場合があるという「言語-行動ギャップ」を解消するためのシステムを提案している。RGB-Dセンサから得た観測に基づき、衝突を考慮したシーンを明示的に構築し、LLMの出力をModel Context Protocol (MCP)に基づくスキーマ検証付きツール呼び出しに制約することで、不正なコマンドをロボットに到達する前に拒否する。検証済みの呼び出しはMoveIt Task Constructorパイプラインで決定論的に実行され、運動学的・衝突チェックを通過した軌道のみがロボットに送信される。物理的なUFactory 850ロボットを用いて、液体・粒体・固体を含む注ぎタスクで最大80%の成功率、把持配置タスクで90%の成功率を達成した。

2. 先行研究と比べてどこがすごい?

従来のLLMベースのプランニングは、言語的な妥当性のみを考慮し、物理的な実現可能性を無視することが多かった。本手法は、LLMの出力をスキーマ検証付きツール呼び出しに制約し、さらにMoveIt Task Constructorによる検証を組み合わせることで、言語と物理のギャップを明示的に橋渡しする点が新しい。特に、MCPを用いた型付き契約により、不正なコマンドを事前に拒否する点が先行研究と比べて優れている。また、スクリプト化されたポリシーが最も簡単なタスクではわずかに上回るものの、最も難しいタスクでは成功率が10%に低下するのに対し、本手法は60%を維持することを示し、堅牢性を実証している。

3. 技術・手法の肝は?

手法の核心は、推論と実行の境界を「型付き契約」として形式化することにある。具体的には、RGB-D観測から衝突を考慮したシーンモデルを構築し、LLMの言語レベルの決定をMCPで定義されたスキーマ検証付きツール呼び出しに制約する。これにより、不正なコマンドはロボットに到達する前に拒否される。検証済みの各呼び出しはMoveIt Task Constructorパイプラインで決定論的に実行され、再構築されたプランニングシーンに対して候補動作が評価される。運動学的および衝突チェックを通過した軌道のみがロボットに送信される「verify-then-act」ステップを採用している。

4. どうやって有効だと検証した?

物理的なUFactory 850ロボットを用いて、液体、粒体、離散固体を含む注ぎタスクを各タスク10回試行し、最大80%の成功率を達成した。また、同じプランニング、プロトコル、検証スタックを用いた把持配置タスクでは90%の成功率を達成した。さらに、スクリプト化されたポリシーと比較し、最も簡単なタスクではスクリプトがわずかに上回るものの、最も難しいタスクではスクリプトの成功率が10%に低下するのに対し、本手法は60%を維持することを示した。

5. 議論はある?

要旨からは、提案手法の限界や潜在的な問題についての議論は明示されていない。ただし、スクリプト化されたポリシーが最も簡単なタスクで本手法を上回る点は、単純なタスクでは過剰な検証がオーバーヘッドになる可能性を示唆している。また、成功率がタスクの難易度に依存することから、より複雑なタスクや環境での汎用性についてはさらなる検証が必要と考えられる。しかし、要旨にはこれらの点に関する詳細な議論は含まれていない。

6. 次に読むべき論文は?

要旨で参照されている関連研究は明示されていないが、LLMを用いたロボット操作プランニングの分野では、"Language Models as Zero-Shot Planners"や"Robot Learning from Language"などの研究が関連する。また、MoveIt Task ConstructorやModel Context Protocol (MCP)に関する技術文書も参考になる。さらに、衝突回避やシーン再構築の手法として、"Voxel Map"や"Signed Distance Field"を用いた研究が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Wenhao Hong, Lan Wei, Dandan Zhang

分類: cs.RO

原文アブストラクト

A language-guided robot operating in a real kitchen must do more than produce a plan that appears correct. It must also execute that plan safely in cluttered environments under imperfect perception. Large language models (LLM) can decompose instructions into action sequences, yet a language-action gap remains: a plan may appear valid linguistically while being physically infeasible under kinematic and collision constraints. We bridge this gap by formalizing the reasoning-execution boundary as a typed contract. From RGB-D observations, the system grounds perceived objects in an explicit, collision-aware scene model and constrains language-level decisions through schema-validated tool calls defined by the Model Context Protocol (MCP), rejecting malformed commands before they reach the robot. Each validated call is deterministically grounded in a MoveIt Task Constructor pipeline, where candidate motions are evaluated against the reconstructed planning scene in a verify-then-act step. Only trajectories that pass both kinematic and collision checks are sent to the robot. On a physical UFactory 850, the method achieves up to 80% success across ten trials per task on pouring tasks involving liquids, granular media, and discrete solids. It achieves 90% success on a grasp-and-place task using the same planning, protocol, and verification stack. Although a scripted policy slightly outperforms our method on the easiest task, its success rate falls to 10% on the hardest, compared with 60% for our method.

関連論文