何が起きたか

研究チームは、汎用事前学習モデルと動作情報を活用した統一潜在アクション世界モデル「Motus」を発表した。Motusは理解・動画生成・行動の3つの専門家を統合するMixture-of-Transformerアーキテクチャを採用し、光学フローを用いて潜在アクションを学習する。実験では、シミュレーションでX-VLAに対して+15%、Pi0.5に対して+45%の性能向上を達成し、実世界でも+11〜48%の改善を報告している。

詳細

Motusは、理解、動画生成、行動の3つの専門家を統合するMixture-of-Transformer(MoT)アーキテクチャを導入する。また、UniDiffuserスタイルのスケジューラを採用し、ワールドモデル、視覚言語行動モデル、逆動力学モデル、動画生成モデル、動画行動統合予測モデルなどの異なるモデリングモードを柔軟に切り替えることを可能にする。さらに、光学フローを利用して潜在アクションを学習し、3段階のトレーニングパイプラインと6層のデータピラミッドを採用することで、ピクセルレベルの「デルタアクション」を抽出し、大規模なアクション事前学習を実現する。

Key Facts

Motusは、理解・動画生成・行動の3つの専門家を統合するMixture-of-Transformer(MoT)アーキテクチャを導入する。出典一覧
MotusはUniDiffuserスタイルのスケジューラを採用し、ワールドモデル、視覚言語行動モデル、逆動力学モデル、動画生成モデル、動画行動統合予測モデルなどのモードを切り替える。出典一覧
Motusは光学フローを利用して潜在アクションを学習し、3段階のトレーニングパイプラインと6層のデータピラミッドを採用する。出典一覧
シミュレーション実験で、MotusはX-VLAに対して+15%、Pi0.5に対して+45%の性能向上を達成した。出典一覧
実世界のシナリオでは、Motusは+11〜48%の改善を示した。出典一覧

本紙の見方

今回のMotusの提案は、身体性AIにおけるモデルの断片化問題への一つの回答と位置づけられる。従来、理解・世界モデル・制御は別々のモデルとして構築されることが多く、大規模な異種データからの学習を妨げていた。Motusはこれらを単一の潜在アクション世界モデルとして統合し、既存の汎用事前学習モデルを活用することで、データ効率と性能の両立を図る点が新しい。特に、光学フローを用いた潜在アクションの学習は、ピクセルレベルの「デルタアクション」を抽出し、大規模なアクション事前学習を可能にする点で技術的な特徴がある。 本紙の過去報道との接続はないが、この分野では、ロボット学習における基盤モデルの活用が進んでおり、Motusはその流れをさらに推し進めるものとみられる。業界構造への含意としては、ロボットの行動学習において、シミュレーションと実世界のギャップを埋める手法として、統一モデルが主流になる可能性が示唆される。また、Motusのアーキテクチャは、異なるモードを切り替えることで、多様なタスクに柔軟に対応できるため、ロボットの汎用性向上に寄与する可能性がある。 未確定の論点としては、実世界での改善幅がシミュレーションよりも小さい点が挙げられる。実世界での+11〜48%の改善は、シミュレーションでの+45%と比較してばらつきが大きく、環境やタスクによる依存性が考えられる。また、Motusの学習には大規模なデータと計算資源が必要とみられ、その実用性やスケーラビリティは今後の検証が待たれる。

なぜ重要か

Motusは、身体性AIにおけるモデル統合の新たな方向性を示すものであり、ロボットの行動学習における基盤モデルの可能性を広げる。特に、シミュレーションと実世界の両方で性能向上を報告しており、実用化への一歩となる可能性がある。今後の展開として、Motusのアーキテクチャがロボット業界の標準的な手法となるか、また大規模データでの学習がどのように進むかが注目される。