何が起きたか

arXivに2026-10-08付で、論文「LeWAM: A JEPA World Action Model with Diffusion-Steering-Based MPC」が掲載された。論文は、世界行動モデル(WAM)を再構成ベースではなく、decoder-freeのJEPA潜在表現で学習するLeWAMを提案している。著者らは、前向き・後ろ向き・逆力学・方策予測の4モードを通じてエンドツーエンドで学習する双方向トランスフォーマーだとしている。

詳細

論文は、LeWAMの潜在表現が通常のLe World Model(前向きのみのJEPA world model)よりも、ロボットと物体の状態を線形プローブでよりよく読み出せると述べる。また、視覚的な攪乱要因をLeWMと同程度に、再構成ベースのWAMよりは大幅に抑え込めるとしている。 行動面では、同じエンコーダを使い同規模で学習した通常のflow-matching policyと、LeWAMの閉ループ評価が一致するとしつつ、LeWAMは世界モデルも同時に提供すると説明している。計画面では、WAMで生の行動をサンプリングしてMPCを行うよりも、方策ヘッドのノイズ空間で計画する方が、世界モデルの動力学誤差をより活用でき、閉ループ性能が向上するとしている。

Key Facts

論文名は「LeWAM: A JEPA World Action Model with Diffusion-Steering-Based MPC」である。[1]
掲載日は2026-10-08で、媒体はarxiv.orgである。[1]
LeWAMはdecoder-freeのJEPA潜在で学習する双方向トランスフォーマーとして説明されている。[1]
学習モードは前向き・後ろ向き・逆力学・方策予測の4つである。[1]
論文は、MPCでは生の行動空間より方策ヘッドのノイズ空間での計画の方が閉ループ性能を改善すると述べている。[1]

本紙の見方

本件の新しさは、世界行動モデル(WAM)を再構成ベースから切り離し、decoder-freeのJEPA潜在と4モード学習を組み合わせた点にある。単なる世界モデルの精度比較ではなく、状態の読み出し、閉ループ行動、MPCでの計画という3層を同じ枠組みで扱っているため、論点は「表現学習」よりも「計画に使える表現かどうか」に移っている。ここで重要なのは、論文が生の行動をそのままMPCに入れるのではなく、方策ヘッドのノイズ空間を使う方がよいとしている点で、表現の質と計画手続きの設計を分けて評価していることである。 本紙の関連記事はないため、過去報道との連続性は置かないが、論文内の比較軸は既存のLe World Modelとreconstruction-based WAMに明確に向いている。つまりLeWAMは、画像復元を中心にした世界モデルの延長線上にあるのではなく、視覚的攪乱を捨てた潜在空間で行動と状態を同時に扱う方向へ寄っている。閉ループ評価が同規模のflow-matching policyと一致するとされる一方で、世界モデルも保持するため、単一の方策モデルよりも「予測と計画の両立」を狙う設計と読める。これは、モデルが高い予測能力を持っていても、MPCの入力表現が不適切なら性能が出にくいという構造を示している。 業界構造への含意は、ロボット基盤モデルの競争軸が、単発の精度指標から、状態表現・方策・計画の接続設計へ移る可能性にある。特に、線形プローブでロボットと物体の状態を読み出せるか、視覚ノイズをどこまで切り捨てられるか、そしてMPCの計画空間をどこに置くかが実装の分岐点になる。今後確認すべき論点は、評価に使ったタスクの範囲、学習データの性質、計画時のノイズ空間設計が他のロボットや別環境でも再現するか、さらに閉ループ性能の差がどの条件で拡大・縮小するかである。

なぜ重要か

論文が示すのは、世界モデルの評価が予測精度だけでは足りず、MPCにどの表現を渡すかが性能を左右しうる点である。著者らは、方策ヘッドのノイズ空間で計画する方が閉ループ性能を改善するとしており、ロボット制御ではモデルの内部表現そのものが実運用上の焦点になる。

日本への影響

日本のロボット研究や制御実装では、視覚復元型のモデルをそのまま使うのではなく、状態抽出と計画空間の設計をどう切り分けるかが論点になる可能性がある。特に、MPCを用いる実機系では、線形プローブで読める状態表現やノイズ空間の扱いが、モデル選定の比較軸になりうる。