日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マルチエージェント/ベンチマークarXiv:2608.28266v1

CoCoBench: 具現化マルチエージェントタスク計画のための協調調整ベンチマーク

CoCoBench: A Cooperative Coordination Benchmark for Embodied Multi-Agent Task Planning

シェア:XThreadsFacebookLINEはてブBluesky

マルチエージェントの協調失敗を細かく診断できるベンチマークCoCoBenchを提案し、897の検証済みインスタンスで4種類の協調構造を評価する。

詳しい要約

1. どんなもの?

CoCoBenchは、マルチモーダル大規模言語モデル(MLLM)を用いたエージェントシステムのための、実行可能な家庭内タスクにおけるマルチエージェント協調を評価するベンチマークである。897のオラクル検証済みインスタンスを含み、タスク割り当て、順序付け、相互排他、ハンドオフ調整という4つの協調コンストラクトに焦点を当てている。タスク成功率に加えて、コンストラクトレベルのスコアを提供し、エージェントが効果的に協調しているかを測定する。

2. 先行研究と比べてどこがすごい?

既存のベンチマークは単一エージェントのタスク完了に焦点を当てるか、マルチエージェントの挙動を全体的なタスク成功率で要約するため、重複作業、順序制約の違反、リソース競合、非同期ハンドオフなどの協調失敗を隠してしまう。CoCoBenchは、協調のコンストラクトレベルで詳細な診断を提供し、協調の種類ごとの能力を評価できる点で優れている。

3. 技術・手法の肝は?

CoCoBenchは、4つの協調コンストラクト(タスク割り当て、順序付け、相互排他、ハンドオフ調整)を中心に設計され、897のオラクル検証済みインスタンスを含む。タスク成功率に加えて、コンストラクトレベルのスコアを提供し、エージェントが効果的に協調しているかを測定する。

4. どうやって有効だと検証した?

11の主要なMLLMを、異なる協調モード、観測入力、エージェント数で評価した。その結果、協調能力はコンストラクト特異的であり、全体的な性能が高いからといって、異なる協調タイプ間でバランスの取れた能力を意味するわけではないことが示された。

5. 議論はある?

要旨からは、協調能力がコンストラクト特異的であることが示唆され、これはターゲットを絞ったモデルアーキテクチャの設計やマルチエージェント協調能力の向上に新たな方向性を与える。しかし、具体的な議論や限界については要旨からは不明。

6. 次に読むべき論文は?

要旨で参照されている関連研究は明示されていないが、同分野の定番として、マルチエージェント協調のベンチマークやMLLMベースのエージェント評価に関する論文が考えられる。具体的には、ALFWorldやVirtualHomeなどのエージェントベンチマーク、またはMLLMのマルチエージェント協調に関する研究が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Yang Chen, Ye-Xin Xie, Lirong Che, Danyang Peng, Yuzhe Yang, Peiwen Lin, Xu Cao, Chuang Wang, Lei Yuan, Jian Su, Lan-Zhe Guo

分類: cs.RO

原文アブストラクト

Agent systems powered by multimodal large language models (MLLMs) have advanced rapidly in recent years, yet existing embodied-agent benchmarks still lack fine-grained diagnostics for multi-agent coordination. Most benchmarks either focus on single-agent task completion or summarize multi-agent behavior with overall task success rates, which can obscure coordination failures such as duplicated work, violations of ordering constraints, resource contention, and desynchronized handoffs. In this paper, we introduce CoCoBench, a construct-level benchmark for evaluating multi-agent embodied coordination in executable household tasks. CoCoBench contains 897 oracle-validated instances organized around four recurring coordination constructs: task allocation, sequential ordering, mutual exclusion, and handoff coordination. In addition to task success rate, CoCoBench provides construct-level scores that measure whether agents coordinate effectively. We evaluate 11 leading MLLMs across different coordination modes, observation inputs, and numbers of agents. The results show that coordination ability is highly construct-specific: strong overall performance does not imply balanced competence across different coordination types. These findings point to new directions for designing targeted model architectures and improving multi-agent coordination ability.