何が起きたか

arxiv.orgに2026年6月1日付で掲載された論文で、COMAPというフレームワークが発表された。COMAPはテキスト世界モデルとエージェント方策を閉ループ相互作用で共進化させ、身体化タスク計画、Webナビゲーション、ツール使用のベンチマークで競合ベースラインを上回る性能を示した。

詳細

COMAPは各意思決定ステップで、世界モデルが候補アクションに対する将来の状態フィードバックを予測し、エージェントがその信頼性を推定してアクションを洗練する。得られたオン方策トラジェクトリは自己蒸留により世界モデルの更新に使われ、エージェントの進化する相互作用分布に適合させる。実験ではQwen3-4Bで相対16.75%の改善を報告している。コードはGitHubで公開されている。

Key Facts

COMAPはテキスト世界モデルとエージェント方策を閉ループ相互作用で共進化させるフレームワークである。[1]
Qwen3-4Bで相対16.75%の改善を達成した。[1]
身体化タスク計画、Webナビゲーション、ツール使用のベンチマークで競合ベースラインを上回った。[1]
世界モデルは自己蒸留によりオン方策トラジェクトリから更新される。[1]
コードはhttps://github.com/loyiv/CoMAPで公開されている。[1]

本紙の見方

今回のCOMAPの提案は、LLMエージェントの分野で「世界モデル」と「方策」を同時に進化させる点で新規性が高い。従来のテキスト世界モデルは訓練後に固定され、エージェントの行動分布の変化に適応できないという課題があった。COMAPは閉ループ相互作用により、世界モデルをエージェントの進化に追従させることで、この課題を解決しようとしている。これは、エージェントが環境と相互作用しながら学習するという、強化学習の文脈では自然な考え方だが、テキストベースの世界モデルに適用した点が新しい。 本紙の過去報道では、LLMエージェントの自己改善や環境適応に関する研究を取り上げてきた。例えば、[本紙の関連記事]として挙げられている「LLMエージェントの自己改善手法の比較」(2025年11月15日)では、外部報酬や検証器に依存しない自己改善の重要性が指摘されていた。COMAPは外部報酬や検証器に依存せず、世界モデルの予測信頼性を自己評価に用いる点で、この流れを踏襲している。また、「テキスト世界モデルの限界と展望」(2026年3月20日)では、世界モデルの固定性が課題として挙げられており、COMAPはその課題に直接応える形となっている。 業界構造への含意としては、LLMエージェントの応用範囲が広がる中で、環境適応性の高いエージェントの需要が高まっている。特に、ロボティクスや自動運転などの身体化AI分野では、実環境との相互作用が不可欠であり、COMAPのようなフレームワークは、シミュレーションと実環境のギャップを埋める可能性がある。また、Webナビゲーションやツール使用の分野では、エージェントが動的な環境に適応することが求められており、COMAPのアプローチは実用的な価値が高いとみられる。 一方で、COMAPの有効性はベンチマーク上での評価に限られており、実環境での性能やスケーラビリティは未確認である。また、世界モデルの予測精度が向上するという分析結果はあるが、そのメカニズムの詳細や、他のモデルサイズでの性能は公開情報では確認できない。今後確認すべき点として、第一に、COMAPが大規模モデル(例えば70B級)でも同様の改善を示すかどうか、第二に、実世界のロボティクス環境での適用事例が存在するか、第三に、世界モデルの予測精度向上が長期的なタスク成功率にどの程度寄与するかの定量評価が挙げられる。

なぜ重要か

COMAPは、LLMエージェントが環境に適応しながら学習する新たなパラダイムを示しており、特に動的な環境での長期的な意思決定が求められる分野での応用が期待される。外部報酬に依存しない自己改善の仕組みは、実環境での適用可能性を高める点で重要である。