日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
人間ロボット協調arXiv:2608.04309v1

隠れた目標下でのゼロショット人間ロボット協調のための構造化LLM推論

Structured LLM Reasoning for Zero-Shot Human--Robot Coordination Under Hidden Goals

シェア:XThreadsFacebookLINEはてブBluesky

プライベートな目標を持つ協調建設タスクにおいて、LLMを用いた構造化アーキテクチャでゼロショットの人間ロボット協調を実現し、ToM推論や階層的計画などを組み合わせて、人間実験で効率性と信頼性を向上させた。

詳しい要約

1. どんなもの?

本論文は、協調建設タスクにおいて、各エージェントがプライベートな目標を持つ状況でのゼロショット人間-ロボット協調を実現するための、構造化された大規模言語モデル(LLM)アーキテクチャを提案している。Dec-POMDP定式化に基づき、意思決定を(i)行動条件付きTheory-of-Mind(ToM)推論、(ii)階層的プランニング、(iii)会話解釈、(iv)行動検証、(v)フィードバックに基づく再プランニングに分解する。

2. 先行研究と比べてどこがすごい?

先行研究では、LLMを直接プランナーとして使用するか、強化学習(RL)エージェントを訓練するアプローチが一般的だが、本手法はLLMを計算困難な推論・プランニングの代替として使用し、物理的実現可能性の検証は従来の手法に委ねる点が新しい。また、ToM推論を明示的に組み込むことで、相手の隠れた目標を推定し、協調効率を向上させる点が優れている。

3. 技術・手法の肝は?

手法の核は、Dec-POMDPに基づくモジュール分解である。具体的には、ToM推論モジュールが相手の行動から目標を推定し、階層的プランナーが推定目標に基づいて計画を生成する。会話解釈モジュールは自然言語の指示を処理し、行動検証モジュールは物理的制約をチェックする。最後に、フィードバックに基づく再プランニングが失敗時に計画を修正する。LLMは各モジュールの計算を近似するために使用される。

4. どうやって有効だと検証した?

人間参加者実験を実施し、提案手法をToM推論なしのアブレーションと、オフラインで多数の目標ペアで訓練されたマルチエージェント強化学習(RL)ポリシーと比較した。その結果、提案手法はベースラインよりも少ないインタラクションステップでタスクを完了し、インタラクション後の信頼評価も高かった。

5. 議論はある?

要旨からは、提案手法の限界や一般化可能性に関する議論は不明。ただし、LLMを計算の代替として使用する際の信頼性や、より複雑なタスクへの拡張性については議論の余地があると考えられる。また、人間の主観的評価に依存する部分があり、客観的な指標との関連性についてはさらなる検証が必要かもしれない。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、Dec-POMDP、Theory-of-Mind、マルチエージェント強化学習、LLMベースのプランニングに関する論文が挙げられる。具体的には、Dec-POMDPの基礎論文、ToMをロボットに適用した研究、LLMを用いたプランニング手法(例:LLM+P)などが関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Dong Hae Mangalindan, Anand Gokhale, Francesco Bullo, Vaibhav Srivastava

分類: cs.RO, eess.SY

原文アブストラクト

We present a structured large-language-model (LLM) architecture for zero-shot human--robot coordination in a cooperative construction task with private goal views. Guided by a Dec-POMDP formulation, the architecture decomposes decision-making into (i) action-conditioned Theory-of-Mind (ToM) inference, (ii) hierarchical planning, (iii) conversation interpretation, (iv) action verification, and (v) feedback-based replanning. We compare the proposed method with an ablation without ToM inference and a multi-agent reinforcement-learning policy trained offline over many goal pairs. In human-participant experiments, the proposed method required fewer interaction steps and yielded higher post-interaction trust ratings than both baselines. These results suggest that systematically decomposing the team decision problem, using LLMs as tractable surrogates for otherwise intractable inference and planning computations, and retaining conventional verification for physical feasibility can improve both task coordination and the human experience.