日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
世界モデル/計画arXiv:2609.03565v1

物理的に基盤づけられたJEPA世界モデルによる目標条件付きロボット計画

Toward Physically Grounded JEPA World Models for Goal-Conditioned Robotic Planning

シェア:XThreadsFacebookLINEはてブBluesky

ロボット制御に有用な表現を学習するため、逆動力学と状態整合を組み込んだJEPA世界モデルを提案し、複数のベンチマークで高い計画成功率を達成した。

詳しい要約

1. どんなもの?

本論文は、視覚的に指定されたゴールに向かうロボットのプランニングのための、物理的に接地されたJEPA (Joint Embedding Predictive Architecture) ワールドモデルを提案している。アクション条件付きJEPAワールドモデルは、将来のピクセルを再構成せずにプランニングを可能にするが、潜在予測だけではロボット制御に関連する情報を表現が保持することを明示的に促進しない。そこで、潜在予測に逆動力学 (IDM) と状態整列 (SA) を追加したエンドツーエンドのJEPAワールドモデルを導入する。IDMは潜在表現の崩壊を防ぎ、潜在遷移をそれを生成したアクションに関して情報豊かにする。SAは連続する表現を関連する物理的構成と運動に接地する。

2. 先行研究と比べてどこがすごい?

先行研究のJEPAワールドモデルは、潜在予測のみに依存しており、表現がロボット制御に必要な情報を保持することを明示的に保証していない。本研究は、IDMとSAを組み合わせることで、表現を物理的状態に接地し、プランニングの成功を向上させる点が新しい。特に、SAを追加することで、IDMのみの場合と比較して、4つのベンチマークタスクすべてでプランニング成功率が一貫して向上することを示した。

3. 技術・手法の肝は?

手法の核は、JEPAワールドモデルにIDMとSAを統合することである。IDMは潜在遷移からアクションを予測する補助タスクを追加し、潜在表現の崩壊を防ぎ、遷移がアクションを反映するようにする。SAは、連続する潜在表現が対応する物理的状態(位置、速度など)と整合するように、状態推定ヘッドを追加して表現を接地する。これにより、表現がロボット制御に有用な情報を保持するようになる。

4. どうやって有効だと検証した?

4つのベンチマークタスク(TwoRoom, PushT, OGBench-Cube, Reacher)で評価した。提案モデルはTwoRoomで100%、PushTで98%、OGBench-Cubeで87%の成功率を達成し、ReacherではLeWorldModelと同等の性能を示した。アブレーション研究では、IDMのみにSAを追加することで、全タスクでプランニング成功率が向上することを確認した。また、遷移部分空間解析により、提案モデルはLeWorldModelよりも高い実効遷移次元を持つことを示した。

5. 議論はある?

LeWorldModelはOGBench-Cubeで平均straighteningが高いが、遷移エネルギーがより低次元の部分空間に集中している。提案モデルはより高い実効遷移次元を持ち、プランニング成功率が向上した。これは、straighteningだけでは不十分であり、遷移の多様性や物理的接地が重要であることを示唆する。ただし、Reacherでの性能が同等である点や、実機での検証が行われていない点は議論の余地がある。

6. 次に読むべき論文は?

要旨で参照されているLeWorldModel、およびJEPA (Joint Embedding Predictive Architecture) の基礎論文、逆動力学モデル (IDM) に関する研究、状態整列 (SA) の関連手法を読むことが推奨される。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Muyuan Liu, Yue Huang, Zheng Liang, Xiang Gao

分類: cs.RO, cs.AI, cs.LG

原文アブストラクト

Action-conditioned JEPA world models enable planning toward visually specified goals without reconstructing future pixels, yet latent prediction alone does not explicitly encourage the learned representations to retain information relevant to robotic control. We introduce an end-to-end JEPA world model that augments latent prediction with inverse dynamics (IDM) and state alignment (SA). While inverse dynamics discourages latent collapse and makes latent transitions informative of the actions that produced them, state alignment grounds consecutive representations in their associated physical configuration and motion. Across four benchmark tasks, our model attains the highest success rates on TwoRoom (100%), PushT (98%), and OGBench-Cube (87%), while performing comparably to LeWorldModel on Reacher. Our ablation further shows that adding state alignment consistently improves planning success over IDM alone across all four tasks. Although LeWorldModel, our primary baseline, attains higher average straightening on OGBench-Cube, transition-subspace analysis shows that its transition energy is concentrated in a substantially lower-dimensional subspace. Our state-aligned model exhibits a higher effective transition dimension than LeWorldModel and improves planning over IDM alone, supporting state alignment as an effective complement to inverse dynamics for robotic planning.

関連論文