何が起きたか

研究チームは、汎用事前学習モデルと動作情報を活用した統一潜在アクション世界モデル「Motus」を発表した。Motusは理解・動画生成・行動の3つの専門家を統合するMixture-of-Transformerアーキテクチャを採用し、光学フローを用いて潜在アクションを学習する。実験では、シミュレーションでX-VLAに対して+15%、Pi0.5に対して+45%の性能向上を達成し、実世界でも+11〜48%の改善を報告している。

詳細

Motusは、理解、動画生成、行動の3つの専門家を統合するMixture-of-Transformer(MoT)アーキテクチャを導入する。また、UniDiffuserスタイルのスケジューラを採用し、ワールドモデル、視覚言語行動モデル、逆動力学モデル、動画生成モデル、動画行動統合予測モデルなどの異なるモデリングモードを柔軟に切り替えることを可能にする。さらに、光学フローを利用して潜在アクションを学習し、3段階のトレーニングパイプラインと6層のデータピラミッドを採用することで、ピクセルレベルの「デルタアクション」を抽出し、大規模なアクション事前学習を実現する。

Key Facts

Motusは、理解・動画生成・行動の3つの専門家を統合するMixture-of-Transformer(MoT)アーキテクチャを導入する。[1]
MotusはUniDiffuserスタイルのスケジューラを採用し、ワールドモデル、視覚言語行動モデル、逆動力学モデル、動画生成モデル、動画行動統合予測モデルなどのモードを切り替える。[1]
Motusは光学フローを利用して潜在アクションを学習し、3段階のトレーニングパイプラインと6層のデータピラミッドを採用する。[1]
シミュレーション実験で、MotusはX-VLAに対して+15%、Pi0.5に対して+45%の性能向上を達成した。[1]
実世界のシナリオでは、Motusは+11〜48%の改善を示した。[1]

なぜ重要か

Motusは、身体性AIにおけるモデル統合の新たな方向性を示すものであり、ロボットの行動学習における基盤モデルの可能性を広げる。特に、シミュレーションと実世界の両方で性能向上を報告しており、実用化への一歩となる可能性がある。今後の展開として、Motusのアーキテクチャがロボット業界の標準的な手法となるか、また大規模データでの学習がどのように進むかが注目される。