何が起きたか

2025年11月15日にarXivで公開された論文『Decoupled Action Expert: Confining Task Knowledge to the Conditioning Pathway』が、VLAモデルの行動生成部の設計に関する新たな知見を報告した。同論文は、タスク固有の知識を条件付け経路に限定し、行動生成のバックボーンをタスク非依存にできると主張している。

詳細

論文では、Diffusion Policyをテストベッドとして、MimicGenとLIBEROのベンチマークで評価。まず、観測なしの前方運動学データで汎用の行動ヘッドを事前学習し、その後凍結して条件付け経路のみを下流タスクで訓練する手法を提案。単一の凍結バックボーンを全タスクで共有しても、通常の訓練と同等の性能を示した。さらに、244MパラメータのU-Netを5MパラメータのMLPに置き換えた場合でも、性能が一致または上回ることを確認した。

Key Facts

論文は2025年11月15日にarXivで公開された。[1]
提案手法では、行動ヘッドを観測なしの前方運動学データで事前学習し、凍結したまま条件付け経路のみを訓練する。[1]
MimicGenとLIBEROのベンチマークで、単一の凍結バックボーンが通常訓練と同等の性能を示した。[1]
244MパラメータのU-Netを5MパラメータのMLPに置き換えても、性能が一致または上回った。[1]
事前学習の信号(関節位置、エンドエフェクタ姿勢、条件なし)は下流性能に影響しなかった。[1]

なぜ重要か

この研究は、VLAモデルの設計原則に一石を投じるものであり、行動生成部の大規模化が必ずしも性能向上につながらないことを示した。ロボット学習の分野では、計算資源の効率的な活用が重要であり、本結果はより軽量で実用的なモデルの開発につながる可能性がある。