何が起きたか

MITらの研究チームは、動画生成モデルをロボット政策に転換する新しいアプローチ「VERA」を発表した。VERAは、アクションなしの動画ワールドモデルと、ロボットの身体ヤコビアンに基づくIDMを組み合わせた閉ループ政策であり、シミュレーションと実世界のベンチマークで高い性能を示した。論文は2026年5月27日にarXivで公開された。

詳細

VERAは、動画プランナーをそのまま使用し、身体特異的な逆動力学モデル(IDM)を訓練するアプローチを取る。この分離により、動画プランナーは身体非依存となり、異なる動画モデルをIDMの再訓練なしに交換でき、IDMは自己対戦データで独立に訓練可能としている。VERAは、ゼロショットのPandaアーム操作と16自由度のAllegroハンドによる器用なキューブ回転を含む、シミュレーションと実世界のベンチマークで強い性能を達成した。同じ動画プランナーを異なる身体特異的IDMと組み合わせることで、複数の身体に適用できるとしている。

Key Facts

VERAは、アクションなしの動画ワールドモデルと、ロボットの身体ヤコビアンに基づくIDMを組み合わせた閉ループ政策である。[1]
VERAは、ゼロショットのPandaアーム操作と16自由度のAllegroハンドによる器用なキューブ回転を含む、シミュレーションと実世界のベンチマークで強い性能を達成した。[1]
同じ動画プランナーを異なる身体特異的IDMと組み合わせることで、複数の身体に適用できる。[1]
VERAのIDM設計は、データ効率が高く、高次元のアクション空間にスケーラブルである。[1]
論文は2026年5月27日にarXivで公開された。[1]

本紙の見方

今回の発表は、ロボット学習における「動画生成モデルをプランナーとして使い、行動は別のモデルで翻訳する」というアーキテクチャの有効性を示す点で新規性がある。従来のロボット基盤モデルは、動画モデルを行動ラベル付きデータで微調整し、将来の観測と行動を同時に予測する方式が主流だった。これに対しVERAは、動画プランナーをそのまま使用し、IDMを別途訓練する「分離」アプローチを採用する。この分離により、動画プランナーは身体非依存となり、異なるロボットへの転用が容易になる。また、IDMは自己対戦データで訓練できるため、データ収集のコストを抑えられる可能性がある。 本紙の過去報道との接続は、関連記事が提供されていないため直接の言及は避けるが、ロボット基盤モデルの研究動向として、動画生成モデルの活用は近年注目を集めており、今回の結果はその流れを後押しするものとみられる。 業界構造への含意としては、ロボット制御の開発において、動画生成モデルとIDMの分離が進めば、動画モデルの汎用性が高まり、ロボットメーカーは自社のロボットに合わせたIDMの開発に注力できるようになる。これにより、ロボットのソフトウェア開発の分業が進み、サプライチェーンに変化が生じる可能性がある。また、IDMの訓練に自己対戦データを利用できることは、実ロボットでのデータ収集の負担を軽減し、開発コストの削減につながる可能性がある。 未確定の論点としては、VERAの実世界での性能が、シミュレーションとどの程度一致するか、また、より複雑なタスクや多様な環境での汎化性が不明である。さらに、IDMの設計がロボットの身体ヤコビアンに依存するため、複雑な身体構造への適用可能性や、動画プランナーの品質がIDMの性能に与える影響も検証が必要である。

なぜ重要か

VERAは、動画生成モデルをロボット制御に活用する新たな道筋を示し、ロボットの汎用性と開発効率の向上に寄与する可能性がある。このアプローチが確立されれば、ロボットメーカーは動画モデルの開発に依存せず、自社のロボットに特化したIDMの開発に注力できるようになり、ロボット開発の分業化が進むとみられる。