何が起きたか

研究チームは、異なるロボット形態(embodiment)をまたいで汎用的に動作するVLAモデル「DyPES-VLA」を開発した。既存手法は、共有ダイナミクス事前知識の活用不足と、異なる動作形式への手動変換の必要性という2つの課題を抱えていた。DyPES-VLAは、視覚言語モデル(VLM)に未来予測目的を課すことで共有ダイナミクス事前知識を学習し、さらにembodiment固有のMixture-of-Experts(MoE)アクションヘッドにより、手動で動作を共通形式に揃えることなく各ロボットのネイティブな動作空間で直接制御を生成する。このヘッドは注意層を共有して時間的な動作構造を捉えつつ、embodiment固有のフィードフォワード専門家が運動学的制約や制御意味論を解決する。評価では、LIBEROで98.0%、RoboCasa-GR1で59.25%、RoboTwin 2.0で89.02%の成功率を達成し、最先端性能を示した。

Key Facts

DyPES-VLAは、共有ダイナミクス事前知識とembodiment固有制御を学習するクロスエンボディメントVLAである。[0]
既存手法の限界として、共有ダイナミクス事前知識の活用不足と、embodiment固有の動作を共通形式に変換する手動前処理の必要性が挙げられている。[0]
DyPES-VLAは、VLMに未来予測目的を課すことで共有ダイナミクス事前知識を学習し、共有クエリ表現が物体の動き、接触、相互作用によるシーン変化を捉える。[0]
embodiment固有のMoEアクションヘッドは、手動で動作を共通形式に揃えることなく、各embodimentのネイティブな動作空間で直接制御を生成する。[0]
MoEアクションヘッドは注意層を共有して時間的な動作構造を捉え、embodiment固有のフィードフォワード専門家が運動学的制約と制御意味論を解決する。[0]
DyPES-VLAは、LIBEROで98.0%、RoboCasa-GR1で59.25%、RoboTwin 2.0で89.02%の成功率を達成し、シミュレーションと実機評価で最先端性能を示した。[0]

なぜ重要か

ロボット操作の分野では、多様なロボット形態に対応する単一の汎用ポリシーの学習が重要な課題となっている。DyPES-VLAは、共有ダイナミクス事前知識の活用と、手動変換を不要にするMoEアーキテクチャにより、クロスエンボディメント転移の効率性と実用性を大幅に向上させる可能性がある。これにより、異なるロボット間での知識共有が促進され、ロボット操作の汎用化が進むと期待される。