何が起きたか
arXivは2026-09-29に、V-JEPA Policyという世界行動モデルの枠組みを公開した。これは、凍結したV-JEPA 2.1エンコーダーの潜在空間上に、指示条件付きの未来潜在予測器とフローマッチング型の行動エキスパートを載せる設計である。論文は、総パラメータ0.9Bのうち0.6Bを学習対象とし、LIBERO、LIBERO-Plus、RoboCasa-GR1で既存のWAMおよびvision-language-actionベースラインと比較した。
詳細
論文によると、V-JEPA Policyは事前学習済みの完全な生成モデルを継承せず、凍結したV-JEPA 2.1 encoderの予測視覚潜在表現を基盤にする。学習は単一の下流段階で行い、instruction-conditioned future-latent predictorとflow-matching action expertを同時に学習する構成である。 また、著者らはDROIDのvideo-instruction pairsを用いて、行動ラベルなしで予測器を事前学習し、それをWAMに適用する実験も行ったとしている。これにより、下流の制御性能と分布外一般化で大きな改善が得られたと論じている。
Key Facts
| V-JEPA Policyは凍結したV-JEPA 2.1 encoderの潜在空間上に構築される世界行動モデルである。 | [1] |
| 総パラメータは0.9Bで、そのうち0.6Bが学習対象である。 | [1] |
| instruction-conditioned future-latent predictorとflow-matching action expertを、単一の下流段階で同時学習する。 | [1] |
| 評価対象はLIBERO、LIBERO-Plus、RoboCasa-GR1である。 | [1] |
| DROIDのvideo-instruction pairsを行動ラベルなしで事前学習した予測器をWAMへ適用すると、下流制御と分布外一般化で改善が得られたと論文は述べる。 | [1] |
本紙の見方
この論文の新しさは、世界行動モデルの基盤を「完全な生成モデルの継承」ではなく、V-JEPA 2.1の予測視覚潜在表現に置いた点にある。既存のWAMが映像生成器や画像編集モデルの大規模事前学習を取り込むのに対し、V-JEPA Policyは凍結エンコーダー上で未来潜在予測器と行動エキスパートを同時に学習するため、モデル設計の主軸が生成そのものから予測表現の利用へ移っている。 数値面では、総計0.9Bパラメータのうち0.6Bが学習対象であることが重要である。全体をゼロから大きく作り込むというより、固定された視覚基盤の上で下流制御を組み上げる構造だと読める。さらに、DROIDのvideo-instruction pairsを行動ラベルなしで予測器に学習させ、それをWAMへ転用すると性能と分布外一般化が改善したとしており、実世界映像から得た未来予測の知識を制御に移植する筋道を示している。 本紙の関連記事はないため、連続報道としての比較はできないが、論文の構成からは「予測表現の転用」が核心であり、従来型のVLAやWAMの比較はその位置づけを補強する材料にとどまる。LIBERO、LIBERO-Plus、RoboCasa-GR1で競争的性能を示した一方で、どのタスク群でどの程度優位だったか、また0.9B/0.6Bの構成が推論時の計算量や実装上の制約にどう効くかは本文からは読み切れない。次に確認すべき論点は、実機制御への移植範囲、学習に使ったDROIDの具体的な寄与、distribution shifts下での優位性の再現条件である。
なぜ重要か
この論文は、ロボット制御を画像生成モデルの流用ではなく、予測視覚潜在表現の上に組み立てる方法を示した点で意味がある。発表元の論文によれば、行動ラベルなしのvideo-instruction pairsから得た予測器をWAMへ転用して下流制御と分布外一般化を改善しており、実世界動画の学習価値を制御系に結びつけている。