日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2610.12407

LeWAM:拡散誘導MPCを用いたJEPA世界行動モデル

LeWAM: A JEPA World Action Model with Diffusion-Steering-Based MPC

シェア:XThreadsFacebookLINEはてブBluesky

JEPA潜在空間上で順・逆・逆動力学と政策を双方向トランスフォーマで予測する世界行動モデルを提案し、政策ヘッドのノイズ空間でMPC計画を行うことで閉ループ性能を向上させた。

詳しい要約

1. どんなもの?

- LeWAMは、World Action Model (WAM) の一種で、双方向Transformerを用いて順方向・逆方向・逆動力学・ポリシー予測を統合したモデル。 - 再構成ベースではなく、decoder-freeのJEPA潜在表現をend-to-endで学習。 - ロボットと物体の状態を潜在から読み取り、視覚的妨害要因を無視する。 - 閉ループ評価では、同じエンコーダで訓練したflow-matchingポリシーと同等の性能を示し、ワールドモデルとしても機能。 - 計画時には、生の行動サンプリングではなくポリシーヘッドのノイズ空間で計画することで性能が向上。

2. 先行研究と比べてどこがすごい?

- 従来の再構成ベースWAMはノイズや冗長情報を含む表現を用いるが、LeWAMはJEPA潜在を用いるため、よりクリーンな表現を実現。 - 順方向のみのJEPAワールドモデル(LeWM)と比較して、線形プローブによるロボット・物体状態の読み取り精度が向上。 - 視覚的妨害要因の無視性能はLeWMと同等で、再構成ベースWAMより大幅に優れる。 - 閉ループ性能はflow-matchingポリシーと同等でありながら、ワールドモデルとしての機能も提供。 - 計画において、生の行動ではなくポリシーヘッドのノイズ空間でサンプリングする新規手法を提案。

3. 技術・手法の肝は?

- 双方向Transformerを採用し、順方向・逆方向・逆動力学・ポリシー予測の4モードを同時に学習。 - decoder-freeのJEPA潜在表現をend-to-endで訓練。 - 計画にはModel Predictive Control (MPC) を用い、ポリシーヘッドのノイズ空間でサンプリングを行う。 - これにより、ダイナミクスモデルの不正確さを回避し、閉ループ性能を向上。

4. どうやって有効だと検証した?

- 線形プローブを用いて、LeWAMの潜在からロボットと物体の状態を読み取り、LeWMや再構成ベースWAMと比較。 - 視覚的妨害要因の無視性能を評価。 - 閉ループ評価を実施し、同じエンコーダで訓練したflow-matchingポリシーと性能を比較。 - 計画タスクにおいて、生の行動サンプリングとノイズ空間サンプリングの性能を比較。

5. 議論はある?

- 計画時に生の行動をサンプリングすると、MPCがダイナミクスモデルの不正確さを利用してしまう問題がある。 - ポリシーヘッドのノイズ空間で計画することで、この問題を軽減し、閉ループ性能を改善。 - ただし、具体的な限界や今後の課題については要旨からは不明。

6. 次に読むべき論文は?

- Le World Model (LeWM): 順方向のみのJEPAワールドモデル。 - 再構成ベースのWorld Action Model (WAM)。 - flow-matchingポリシー。 - Model Predictive Control (MPC) を用いた計画手法。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Shashank Hegde, Alexander Popov, Elie Aljalbout, Nikolai Smolyanskiy

分類: cs.RO, cs.AI, cs.CV

原文アブストラクト

World action models (WAMs) predict actions and future observations, typically from a reconstruction-based representation that carries noisy, redundant information which can complicate downstream predictions. We introduce LeWAM, a bidirectional transformer for forward, backward, inverse dynamics and policy prediction, on a decoder-free JEPA latent trained end-to-end through all four modes. We see the following benefits: 1) Alignment: linear probes read robot and object state from LeWAM's latent better than from a regular Le World Model (a forward-only JEPA world model), while the latent ignores visual distractors as well as LeWM does and far better than a reconstruction-based WAM. 2) Acting: Closed-loop evaluations of LeWAM match a regular flow-matching policy trained on the same encoder at matched size, while also providing a world model. 3) Planning: Sampling raw actions when planning with WAMs lets MPC exploit dynamics-model inaccuracies; planning in the noise space of the policy head instead improves the closed-loop performance of these WAMs.

関連論文

PR本紙発行元 EmplifAI