何が起きたか
MT-WAMは、arxiv.orgで2026-09-18に公開された論文で、未来動画を推論時に生成せずに行動生成を改善する枠組みを示した。動画バックボーンの最終ブロックを複製した軽量な二重ストリーム分岐に、未来の2次元点軌跡と視覚特徴への補助監督を加える設計である。推論時は、1回の再計画ごとに計算した動画キャッシュとモーションキャッシュを使い、未来動画予測を省く。
詳細
論文は、既存の訓練目的を維持したまま、未来の2次元点軌跡と視覚特徴に関する補助的な監督を追加すると説明している。動画バックボーンの最終ブロックから複製した軽量な二重ストリーム分岐を用い、ストリーム間の注意を抑える構造化アテンションマスクを導入し、モーションストリームのトークンを行動エキスパートへの追加ダイナミクス条件として使う。未来視覚特徴の予測は、物体構造と空間構造を捉える特徴空間で監督を与えるとしている。 性能面では、追加のembodied policy pretrainingなしに、LIBEROで成功率98.2%、LIBERO-Plusで73.7%を達成し、後者ではFast-WAMを23.8ポイント上回った。RoboTwin 2.0 Clean2RandではRandom成功率が6.30%から19.40%に上がり、実世界4課題では平均成功率が67.0%から77.8%になった。
Key Facts
| MT-WAMは未来動画を推論時に生成せず、動画とモーションのキャッシュを1回の再計画ごとに使う。 | [1] |
| 補助監督として、未来の2次元点軌跡と視覚特徴を加える。 | [1] |
| 動画バックボーンの最終ブロックを複製した軽量な二重ストリーム分岐と、ストリーム間注意を抑える構造化アテンションマスクを用いる。 | [1] |
| 追加のembodied policy pretrainingなしで、LIBEROで98.2%、LIBERO-Plusで73.7%の成功率を示した。 | [1] |
| RoboTwin 2.0 Clean2RandでRandom成功率は6.30%から19.40%に上がり、実世界4課題の平均成功率は67.0%から77.8%に上がった。 | [1] |
本紙の見方
MT-WAMの新しさは、行動生成のために未来動画そのものを出力するのではなく、未来の2次元点軌跡と視覚特徴を補助監督として使い、既存の動画バックボーンから得た表現を再配線した点にある。つまり、生成対象を「未来の映像」から「行動に効く動きと視覚の条件」に寄せた設計であり、推論時に未来動画を省くという方針とも整合している。Fast-WAMが動画・動作の共学習で制御性能を高めた流れを引き継ぎつつ、MT-WAMは予測の重心を制御向けの中間表現へ移した形である。 本紙の見方では、ここで重要なのは性能差そのものより、どの情報をキャッシュし、どの情報を捨てたかである。MT-WAMは動画キャッシュとモーションキャッシュを1回の再計画ごとに使い、追加のビデオ生成を走らせないため、推論経路はFast-WAMより短い。これは、視覚条件が変化する場面でも、物体構造と空間構造を特徴空間で保持して行動生成に渡す設計を意味する。動画バックボーンの末端ブロックを複製した二重ストリーム分岐、構造化アテンションマスク、モーションストリームの追加条件という3点は、表現学習を単なる予測精度ではなく制御に最適化するための具体的な実装だと読める。 LIBERO、LIBERO-Plus、RoboTwin 2.0 Clean2Rand、実世界4課題という複数の評価で改善が示された一方、論文本文だけでは学習データの範囲、再計画の頻度、推論時の計算量、どのタスクで改善が大きいかの内訳は読み切れない。次に確認すべきなのは、未来動画を省く設計が実運用の遅延や計算資源にどう効くか、また視覚特徴の監督がどの条件変化に強いのかである。
なぜ重要か
発表元のarxiv.orgによれば、MT-WAMは未来動画を推論時に生成せずに行動生成を改善するとしている。これは、視覚生成を伴う制御系に対して、映像そのものより行動に必要な中間表現をどう設計するかが重要になることを示す。