日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
arXiv:2608.04309

Structured LLM Reasoning for Zero-Shot Human--Robot Coordination Under Hidden Goals

Structured LLM Reasoning for Zero-Shot Human--Robot Coordination Under Hidden Goals

シェア:XThreadsFacebookLINEはてブBluesky

詳しい要約

1. どんなもの?

本論文は、協調的な建設タスクにおいて、各エージェントが自身の目標のみを観測できる(private goal views)状況下でのゼロショット人間-ロボット協調を実現する、構造化された大規模言語モデル(LLM)アーキテクチャを提案する。Dec-POMDP の定式化に基づき、意思決定を (i) 行動条件付き Theory-of-Mind (ToM) 推論、(ii) 階層的プランニング、(iii) 会話解釈、(iv) 行動検証、(v) フィードバックに基づく再プランニングの5つのモジュールに分解する。

2. 先行研究と比べてどこがすごい?

先行研究では、LLM を直接プランナーとして使用するか、強化学習(RL)エージェントを多数の目標ペアでオフライン訓練するアプローチが一般的である。本手法は、LLM を扱いにくい推論・プランニング計算のための tractable な代替手段として用い、従来の検証手法を物理的実現可能性の確認に残すことで、システム全体の分解を図る点が新しい。また、ToM 推論を明示的に組み込むことで、相手の隠れた目標を推定し、協調効率を向上させる点が先行研究と異なる。

3. 技術・手法の肝は?

手法の核心は、Dec-POMDP に基づく構造化されたモジュール分解にある。具体的には、各ステップで (i) 行動条件付き ToM 推論により相手の目標を推定し、(ii) 階層的プランニングで行動を選択、(iii) 自然言語による会話を解釈して情報を統合、(iv) 物理的制約を検証、(v) フィードバックに基づいてプランを修正する。LLM は各モジュールの推論エンジンとして機能し、従来の厳密な計算を近似する。

4. どうやって有効だと検証した?

人間参加者実験を実施し、提案手法を (a) ToM 推論を除いたアブレーション、(b) 多数の目標ペアでオフライン訓練されたマルチエージェント強化学習(MARL)ポリシーと比較した。評価指標は、タスク完了までのインタラクションステップ数と、インタラクション後の信頼度評価(trust ratings)である。結果、提案手法は両ベースラインよりも少ないステップ数でタスクを完了し、高い信頼度を得た。

5. 議論はある?

要旨からは、提案手法の限界や一般化可能性に関する議論は明示されていない。ただし、LLM を tractable な代替手段として用いることの計算コストや、ToM 推論の精度がタスク性能に与える影響、実環境での物理的検証の重要性などが示唆される。また、ゼロショット設定であるため、訓練データにない目標ペアへの適応性が評価されているが、より複雑なタスクや動的環境での性能は不明である。

6. 次に読むべき論文は?

要旨で参照・比較されている研究として、マルチエージェント強化学習(MARL)ポリシーが挙げられる。また、Dec-POMDP の定式化に基づくため、Dec-POMDP の解法に関する研究(例:オンライン計画、信念状態推定)が関連する。さらに、Theory-of-Mind をロボットに実装した研究や、LLM を用いたプランニング・推論の研究(例:LLM を用いたタスクプランニング)が次に読むべき論文として考えられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Dong Hae Mangalindan, Anand Gokhale, Francesco Bullo, Vaibhav Srivastava

分類: cs.RO, cs.SY, eess.SY

原文アブストラクト

We present a structured large-language-model (LLM) architecture for zero-shot human--robot coordination in a cooperative construction task with private goal views. Guided by a Dec-POMDP formulation, the architecture decomposes decision-making into (i) action-conditioned Theory-of-Mind (ToM) inference, (ii) hierarchical planning, (iii) conversation interpretation, (iv) action verification, and (v) feedback-based replanning. We compare the proposed method with an ablation without ToM inference and a multi-agent reinforcement-learning policy trained offline over many goal pairs. In human-participant experiments, the proposed method required fewer interaction steps and yielded higher post-interaction trust ratings than both baselines. These results suggest that systematically decomposing the team decision problem, using LLMs as tractable surrogates for otherwise intractable inference and planning computations, and retaining conventional verification for physical feasibility can improve both task coordination and the human experience.