日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
計画/強化学習arXiv:2608.08523

多様な計画ポリシーの発見:品質多様性最適化によるマルチモーダル具現化エージェント

Discovering Diverse Planning Policies for Multimodal Embodied Agents with Quality-Diversity Optimization

シェア:XThreadsFacebookLINEはてブBluesky

マルチモーダル具現化エージェントのための多様な計画ポリシーを品質多様性最適化で発見し、行き詰まり時に別のポリシーへ切り替えることでタスク成功率を向上させる。

詳しい要約

1. どんなもの?

本論文は、マルチモーダル具現化エージェントのための多様なプランニングポリシーを発見するQuality-Diversity (QD)フレームワークを提案している。長期的タスクにおいて、視覚観察、テキスト目標、相互作用履歴を統合して閉ループ意思決定を行うエージェントが、単一のプランニングスタイルに依存せず、行き詰まり時に別のポリシーへ切り替えられるようにする。オフライン段階でポリシーテンプレートを進化させ、行動空間に基づくアーカイブに保持し、オンライン段階で行き詰まり検出時にロールバックとポリシー切り替えを行う。

2. 先行研究と比べてどこがすごい?

従来の大規模モデルベースのプランナーは、実行中に単一の支配的なプランニングスタイルに依存し、そのモードが非効率になると長時間停滞する問題があった。本手法は、単一のプロンプトスタイルへの探索を崩壊させず、行動インデックス付きアーカイブに複数のポリシーを保持する点で優れている。また、成功・失敗経験を構造化してポリシー変異に活用することで、多様なポリシーを効率的に発見できる。

3. 技術・手法の肝は?

手法の核は、QDフレームワークを用いてプランニングポリシーテンプレートを進化可能な個体として扱い、行動空間(相互作用強度と目標指向性)で定義されるニッチごとに最高品質のポリシーをアーカイブに保持すること。オフラインでは、ロールアウト軌跡から成功・失敗経験を要約し、組換えと経験誘導型突然変異によりポリシー変異を導く。オンラインでは、タスク進捗を監視し、持続的な停滞を検出すると最新のチェックポイントにロールバックし、行動的に異なるアーカイブポリシーに切り替えて実行を再開する。

4. どうやって有効だと検証した?

ThreeDWorld輸送ベンチマークで実験を行い、提案フレームワークが代表的なベースラインプランナーと比較して、タスク成功率と相互作用効率を向上させることを示した。具体的な数値や比較対象の詳細は要旨からは不明。

5. 議論はある?

要旨からは、提案手法が多様なポリシーレパートリーを発見することで適応的なマルチモーダルプランニングとオンライン障害回復を支援する有効性が示唆されているが、限界や今後の課題については言及されていない。また、実験は特定のベンチマークに限定されており、他の環境やタスクでの汎用性は不明。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、Quality-Diversity最適化、マルチモーダル具現化エージェントのプランニング、大規模モデルベースのプランナー、ThreeDWorldベンチマークに関する論文が挙げられる。具体的には、QDアルゴリズム(MAP-Elitesなど)、具現化AIのための視覚言語モデル、閉ループプランニング手法などが関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Pengfei Xu, Yong Liu, Xiaoya Nan, Qiang Yang, Peilan Xu

分類: cs.AI

原文アブストラクト

Multimodal embodied agents are increasingly required to solve long-horizon tasks by integrating visual observations, textual goals, and interaction history into closed-loop decision making. However, state-of-the-art large-model-based planners often rely on a single dominant planning style during execution. Once this execution mode becomes ineffective, the agent may remain stalled for many steps, repeatedly interacting with the environment without making meaningful progress. We address this limitation by proposing a Quality-Diversity (QD) framework for discovering diverse planning policies for multimodal embodied agents. The proposed method treats planning-policy templates as evolvable individuals and organizes them into a behavior-indexed archive rather than collapsing search to a single prompt style. In the offline stage, rollout trajectories are summarized into structured success and failure experiences, which guide policy variation through recombination and experience-guided mutation. The resulting policies are mapped into a behavior space defined by interaction intensity and goal-directedness, and the highest-quality policy in each niche is retained in the archive. In the online stage, the agent executes one policy at a time while monitoring task progress. When persistent stall is detected, the system rolls back to the latest checkpoint and switches to a behaviorally distinct archive policy to resume execution. Experiments on the ThreeDWorld transport benchmark show that the proposed framework improves both task success and interaction efficiency over representative baseline planners. These results suggest that discovering diverse policy repertoires is an effective way to support adaptive multimodal planning and online failure recovery.