何が起きたか

arXivに2025年10月1日付で公開された論文「Compose Your Policies! Improving Diffusion-based or Flow-based Robot Policies via Test-time Distribution-level Composition」において、研究チームは追加のモデル学習を必要としないテスト時合成手法「General Policy Composition (GPC)」を提案した。GPCは、複数の事前学習済みポリシーの分布スコアを凸結合し、テスト時探索を行うことで、個々のポリシーを上回る性能を達成するとしている。

詳細

論文は、ロボット制御における拡散モデルベースのポリシー(VLAやVAポリシー)の性能向上は、大規模なインタラクションデータの取得コストに制約されると指摘。GPCは追加学習なしで既存ポリシーを組み合わせる新たなパラダイムを提示する。理論的には、複数の拡散モデルの分布スコアの凸合成が、個々のスコアよりも優れた一段階の関数目的を達成できることを示し、Grönwall型のバウンドを用いて、この改善が生成軌道全体に伝播し、システム全体の性能向上につながると論じている。 GPCは、VAモデルとVLAモデル、拡散ベースとフローマッチングベースなど、異種のポリシーをプラグアンドプレイで合成できる汎用性を持つ。実験では、Robomimic、PushT、RoboTwinの各ベンチマークと実機ロボット評価で、GPCが多様なタスクにおいて性能と適応性を一貫して向上させたと報告。さらに、代替の合成演算子や重み付け戦略の分析を通じて、GPCの成功メカニズムへの洞察も提供している。

Key Facts

論文はarXivに2025年10月1日付で公開された(識別子: 2510.01068v2)。[1]
提案手法は「General Policy Composition (GPC)」と呼ばれ、追加のモデル学習を必要としない。[1]
GPCは複数の事前学習済みポリシーの分布スコアを凸結合し、テスト時探索を行う。[1]
理論的には、複数の拡散モデルの分布スコアの凸合成が、個々のスコアよりも優れた一段階の関数目的を達成できると示された。[1]
Grönwall型のバウンドを用いて、一段階の改善が生成軌道全体に伝播し、システム全体の性能向上につながると論じている。[1]
GPCはVAモデルとVLAモデル、拡散ベースとフローマッチングベースなど、異種のポリシーをプラグアンドプレイで合成できる。[1]
実験はRobomimic、PushT、RoboTwinの各ベンチマークと実機ロボット評価で実施された。[1]
実験結果は、GPCが多様なタスクにおいて性能と適応性を一貫して向上させたことを示している。[1]
論文は、代替の合成演算子や重み付け戦略の分析も提供している。[1]

なぜ重要か

ロボット制御における拡散モデルポリシーの性能向上は、大規模データの取得コストに制約されてきた。GPCは追加学習なしで既存ポリシーを合成するため、データ収集の負担を増やさずに性能を改善できる可能性がある。理論的裏付けと複数ベンチマークでの実証により、ロボットポリシーの性能向上手法として新たな選択肢を示す。