何が起きたか

arXivに2026-10-07付で掲載された論文「Video Prediction Policy 2: Predict Better, Act Better」は、World action models(WAMs)の改良版VPP2を提案した。論文では、VPP2-14Bがオープンエンド課題の動画予測指示追従成功率でCosmos3-64Bを11.0ポイント上回り、実世界のゼロショットALOHA操作課題では最強ベースラインを18.5ポイント上回ったとしている。さらに、LIBERO-Pro、LIBERO-OOD、RoboDojoの評価でも、ベンチマーク別の追加学習後に最高成功率を示したとしている。

詳細

論文は、既存のWAMがオープンエンド環境で誤った動作予測を出しやすい要因として、基盤動画モデルが操作向けに最適化されていないことと、行動要素の単純な統合が汎化性能を損ねることを挙げている。これに対しVPP2では、操作動画の大規模で多様なデータセットを用いて基盤動画モデルの継続事前学習を行い、詳細なキャプション付きのイベントレベル事前学習で汎化を促した。

Key Facts

論文名は「Video Prediction Policy 2: Predict Better, Act Better」である。[1]
掲載日は2026-10-07である。[1]
VPP2はWorld action models(WAMs)の一種として提案された。[1]
VPP2-14BはCosmos3-64Bを、オープンエンド課題の動画予測指示追従成功率で11.0ポイント上回ったとしている。[1]
VPP2は実世界のゼロショットALOHA操作課題で、最強ベースラインを18.5ポイント上回ったとしている。[1]

本紙の見方

今回の論文の新規性は、動画予測を行動生成の土台として使うWAMの枠組みを、単なる統合ではなく「継続事前学習→イベントレベル事前学習→単一ステップ視覚プランナ→MoTによる行動モジュール」という工程に分解して再設計した点にある。ここで重要なのは、著者らが性能向上を動画予測精度だけでなく、指示追従成功率や実機操作のゼロショット成功率で示したことで、視覚予測と制御の間を埋める設計が主題になっている点である。これは、モデル規模の拡大それ自体よりも、予測の固定地平化と行動モジュールの分離が効いた可能性を示す結果と読める。 本紙の関連記事はないため過去報道との接続は置かないが、論文内の構成は、動画基盤モデルを操作向けに再利用するという既定路線の延長線上にありつつ、既存WAMの弱点を「一般動画モデルの転用」と「行動部品の雑な後付け」に分けて整理している点で一歩踏み込む。特に、VPP2-14BとCosmos3-64Bの比較は、単に大きいモデルが強いという話ではなく、14Bでも訓練の組み方次第で64Bを上回りうることを示唆する。ただし、この差がデータ構成、アーキテクチャ、あるいは後処理のどこに最も効いているのかは、本文だけでは切り分けきれない。 業界構造への含意としては、WAMの競争軸が「モデルサイズ」から「動画事前学習の設計」と「行動モジュールの接続方式」に移りつつあることが読み取れる。とくに、詳細キャプション付きの操作動画やイベントレベル学習が重要なら、次のボトルネックは演算資源よりも、操作データの収集方法、ラベリング粒度、ベンチマークごとの後学習手順になる可能性が高い。論文はLIBERO-Pro、LIBERO-OOD、RoboDojoでも高い成功率を示したとしているが、これらの汎化が実機の長い作業系列や未知物体環境にどこまで続くかは未確定である。 今後確認すべき論点は、VPP2-14Bの学習データの規模と構成、MoTの具体的な実装、固定予測地平の長さ、そしてベンチマーク別後学習の条件である。特に、ゼロショットALOHAの結果がどの程度再現可能か、また動画予測の改善がそのまま実機操作にどこまで接続するかは、論文の主張を実運用に近づけるうえでの焦点になる。

なぜ重要か

著者らの主張が正しければ、ロボット政策の性能向上は単純なスケール拡大だけでなく、操作動画の扱い方と行動モジュールの設計に依存することになる。これは、動画基盤モデルをロボット制御に転用したい研究開発チームにとって、データ設計と学習段階の再編が実装上の課題になることを意味する。