何が起きたか
arXivは2026-09-17、MoWAM(Explicit Future Motion Prediction for Efficient World Action Models)を公開した。MoWAMは、World Action Models(WAMs)で推論時に未来動画を生成する方式の計算負荷を避け、将来のロボット動作を明示的に予測する設計である。論文は、推論時に動画生成を完全に外しながら、未来表現を保つことで効率と頑健性の両立を狙うとしている。 同論文では、Mixture-of-Transformerアーキテクチャを用いて学習時に未来の視覚動態を学び、motionとactionを同時に予測する。さらに、複数のmotion-action候補をサンプルし、motion-awareなtask-progress verifierで選別することで、推論時のスケーリングにも対応する。
詳細
論文は、未来動画の完全生成を「structured robot motion as a compact abstraction of the future」に置き換える点を中核に置く。推論時には動画生成を行わず、現在のシーンと相互作用制約の下でロボットがどう変化するかをmotion表現として扱う。 評価はLIBERO、LIBERO-Plus、実世界のマニピュレーションタスクで行われた。著者らは、MoWAMが代表的なWAMベースラインに対して、分布内性能、分布外頑健性、実世界の平均成功率で高い結果を示したとしている。また、候補数を増やすほど性能が向上し、明示的な未来モーション表現が推論時スケーリングの基盤になると述べている。
Key Facts
| MoWAMはFuture video generationを推論時に行わず、explicit future motion predictionに置き換えるWAMである。 | [1] |
| MoWAMはMixture-of-Transformer architectureを用い、学習時にfuture visual dynamicsを捉えつつmotionとactionをjointly predictingする。 | [1] |
| 推論時には複数のmotion and action pairsをsampleし、motion-aware task-progress verifierで選別する。 | [1] |
| 評価対象はLIBERO、LIBERO-Plus、real-world manipulation tasksである。 | [1] |
| 論文は、分布内性能、out-of-distribution robustness、higher average real-world successが代表的WAM baselinesより良いとしている。 | [1] |
本紙の見方
MoWAMの新しさは、WAMの推論時に未来動画を生成するという重い経路を切り離し、代わりに将来のモーションを明示表現として持たせた点にある。既定路線の延長としては、未来を使って方策を安定化させるWAM系の考え方自体は維持しており、完全に別系統へ転じたわけではない。ただし、動画生成を外しながら未来情報を残すという設計変更は、計算量と表現力の折り合いをどこで取るかという、WAMの実装上の核心を直接動かしている。 本紙の関連記事はないため、過去報道との連続性は置かずに読むべきである。論文の主張だけを見ると、MoWAMは「未来を再生するモデル」から「未来の動きを圧縮して扱うモデル」への移行を示す。ここで重要なのは、単に軽量化したのではなく、motion-aware task-progress verifierを含めて、候補を複数生成して選ぶ推論時スケーリングの枠組みまで含めて設計している点である。つまり、計算削減と精度維持を同時に狙う構造が、動画生成の省略によって逆に前面に出たとみられる。 業界構造への含意としては、ロボット方策の性能競争が、単純な生成モデルの大きさではなく、未来表現をどれだけ圧縮して評価系まで一体化できるかに移る可能性がある。実機操作タスクで平均成功率を確認したことは、シミュレーション上の指標だけではなく、実世界での遷移表現と選別機構が論点になることを示す。LIBEROとLIBERO-Plusでの評価が示すのは、学習済み表現の一般化だけでなく、分布外頑健性をどの表現で担保するかという争点である。 未確定の論点は、候補数を増やした際の計算コストと成功率の増分、task-progress verifierの具体的な判定基準、実世界タスクの条件、そしてベースラインとの差がどの設定で最も大きいかである。論文要旨だけでは、どの程度の操作難易度で優位性が持続するか、また動画生成を省いたことで失われる失敗例が何かまでは読めない。
なぜ重要か
MoWAMは、推論時に未来動画を作らずに済むため、ロボット方策の実運用で計算負荷を抑えながら未来情報を使う設計として読める。論文がLIBERO、LIBERO-Plus、実世界操作での改善を示したことは、シミュレーション専用の工夫ではなく、実機寄りの評価軸で検証した点に意味がある。 また、複数候補のサンプリングと選別を組み合わせる構成は、単一予測に依存しない実行系の設計余地を示す。ロボット学習で問題になりやすい分布外条件に対して、未来動作を明示表現として持つことがどこまで有効かが焦点になる。