日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLA/社会的知能arXiv:2608.20975

信念なき行動:視覚言語モデルにおける心の理論の協調的社会行動への変換の測定

Belief Without Behavior: Measuring the Translation of Theory of Mind into Coordinated Social Action in Vision-Language Models

シェア:XThreadsFacebookLINEはてブBluesky

心の理論の推論と社会的行動のギャップを測るベンチマークMOSAICを導入し、VLMがToM制約下で一貫した行動を生成できないことを示した。

詳しい要約

1. どんなもの?

本論文は、視覚言語モデル(VLM)が心的状態の推論(Theory of Mind, ToM)を実際の社会的行動(言語・非言語の協調)に変換できるかを評価するための新しいベンチマーク「MOSAIC」を提案している。MOSAICは、2つの具現化エージェントが協力・競争シナリオで相互作用し、言語、空間軌跡、視線方向、表情を統合する必要がある制御されたタスクを含む。ToMの制約条件を系統的に変化させ、13モデル(11のVLMを含む)を各200試行で評価した。

2. 先行研究と比べてどこがすごい?

既存のベンチマークはToM推論と身体化された行動を別々に評価しており、社会的推論と社会的行動の間のギャップを測定していない。MOSAICは、両者を統合し、推論から行動への変換を直接評価する点が新しい。また、ToMの順序制約(1次、2次など)を明示的に操作し、行動への影響を調べる点も独自性がある。

3. 技術・手法の肝は?

MOSAICは、協力・競争シナリオで2エージェントが相互作用するタスクを設計し、ToMの順序制約(例:相手の信念の信念)を系統的に変化させる。各試行で、エージェントの言語発話、空間軌跡、視線、表情を記録し、期待される行動との整合性を評価する。モデルには、明示的なToMモジュールを持つPCM-LLM(構造的参照点)と、様々なVLMが含まれる。

4. どうやって有効だと検証した?

13モデル(11のVLMとPCM-LLMを含む)を各200試行で評価した。結果、VLMはToM順序制約下で期待される行動と整合する行動を生成できず、明示的なToM制約を課しても行動に信頼できる変化が見られなかった。信号レベルの分析により、2つの連続的なボトルネックを特定:①多くのモデルが方向的に一貫した非言語信号を生成できない、②信号が存在しても、VLMエージェントは他者の行動を解釈して反応できない。PCM-LLMは全条件で成功し、明示的な信念-行動結合がこの種のタスクに十分な要素であることを示した。

5. 議論はある?

議論として、VLMがToM推論と行動の統合に失敗する原因は、非言語信号の生成能力の欠如と、他者行動の解釈能力の欠如にあると考察している。また、PCM-LLMの成功は、明示的な信念-行動結合の重要性を示唆するが、VLMのスケーラビリティや汎用性とのトレードオフが議論される可能性がある。さらに、ベンチマークのタスクが人工的であり、現実の社会的相互作用の複雑さを完全には捉えていないという限界も考えられる。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、ToM推論のベンチマーク(例:ToMi)や身体化されたエージェントの行動評価(例:Social Navigation)が挙げられる。また、PCM-LLMの設計に基づく、明示的なToMモジュールを統合したVLMの研究が次に読むべき論文として考えられる。具体的な論文名は要旨に明記されていないため、同分野の定番として、ToM推論のベンチマークやVLMの社会的推論に関する研究を挙げる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Tonglin Yan, Gregoire Sergeant-Perthuis, David Rudrauf

分類: cs.AI

原文アブストラクト

Effective social interaction requires agents to translate mental state inferences into coordinated behavioral signals across verbal and nonverbal channels simultaneously. Yet existing benchmarks evaluate theory of mind (ToM) reasoning and embodied behavior in isolation, leaving unmeasured the gap between social inference and social action. We introduce MOSAIC (Multimodal Orchestration of Social Action, Inference, and Communication), a controlled benchmark in which two embodied agents interact across cooperative and competitive scenarios requiring integration of verbal statements, spatial trajectories, gaze direction, and facial expression under systematically varied ToM constraints. Evaluating 13 models, including 11 VLMs, across 200 trials per model, we find that VLMs fail to produce behaviors consistent with the expected outcomes under ToM-order constraints, and that imposing explicit ToM-order constraints produces no reliable behavioral change aligned with the specified reasoning level. Signal-level analysis reveals two sequential bottlenecks: most models cannot produce directionally coherent nonverbal signals, and even when signals are present, VLM agents fail to interpret others behaviors and react to them. PCM-LLM, included as a structured architectural reference point with an explicit ToM module, succeeds across all conditions, suggesting that explicit belief-action coupling is a sufficient ingredient for this class of tasks.