日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
世界モデルarXiv:2608.24044

XP-JEPA: 予測可能な潜在ダイナミクスのための交差予測物理基盤

XP-JEPA: Cross-Predictive Physics Grounding for Forecastable Latent Dynamics

シェア:XThreadsFacebookLINEはてブBluesky

視覚と物理状態を別々に符号化し、共有予測器で両方を進めることで、物理遷移に基づく潜在ダイナミクスを学習する手法を提案。訓練後に物理ブランチを捨て、視覚のみで制御可能。

詳しい要約

1. どんなもの?

XP-JEPAは、視覚的な潜在世界モデルを物理的軌跡で接地する手法。視覚観測と物理状態を別々にエンコードし、共有の行動条件付き予測器で両方を進め、各予測を将来の両表現にマッチさせる。訓練後は物理ブランチを破棄し、展開時は視覚のみのモデルを使用する。

2. 先行研究と比べてどこがすごい?

従来の自己予測モデル(JEPAなど)はエンコーダと予測器が共適応し、物理的進化に弱く制約された潜在遷移を学習しがち。XP-JEPAは特権的な物理軌跡を接地に用いることで、予測可能かつ物理的に根ざした潜在ダイナミクスを学習する点が新しい。

3. 技術・手法の肝は?

視覚エンコーダと物理エンコーダを別々に持ち、共有の行動条件付き予測器で両モダリティの潜在表現を進化させる。各予測を将来の視覚表現と物理表現の両方にマッチさせるクロス予測目的を導入。訓練後は物理ブランチを破棄し、視覚のみで展開。

4. どうやって有効だと検証した?

6つの評価サブファミリーからなるマルチタスクスイートで評価。新しく適合させた予測器のロールアウトドリフトを0.361から0.104に低減し、平均制御成功率を53.6%から78.2%に向上。直接の物理状態回帰は位置デコーダビリティを上げるが、予測可能性と制御は視覚のみのベースラインに近いことを示した。

5. 議論はある?

クロス予測による物理的接地が、テスト時の特権入力を必要とせずに、ロールアウトベースの制御のための予測可能な潜在ダイナミクスを生成できることを示す。しかし、物理状態の定義や、物理ブランチの設計選択が結果に与える影響についての詳細は要旨からは不明。

6. 次に読むべき論文は?

要旨で参照されている先行研究として、自己予測モデル(JEPA)や潜在世界モデル(World Models)が挙げられる。具体的には、I-JEPAやMC-JEPAなどのJEPA関連研究、およびDreamerやMuZeroなどのモデルベース強化学習の研究が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Kehan Wen, Ziming Li, Siyuan Luo, Fan Shi

分類: cs.LG

原文アブストラクト

Latent world models plan by predicting how candidate actions transform learned representations. In self-predictive models, however, the encoder and predictor are optimized jointly and can co-adapt to latent transitions that are easy to predict but only weakly constrained by the physical evolution of the scene. We introduce the cross-predictive JEPA (XP-JEPA), which grounds visual latent dynamics in privileged physical trajectories. XP-JEPA separately encodes visual observations and physical states, advances both through a shared action-conditioned predictor, and matches each prediction to both future representations. This objective encourages unified latent dynamics across the two modalities, grounded in the underlying physical transitions. The physical branch is discarded after training, leaving a visual-only model at deployment. On a multi-task suite spanning six evaluation subfamilies, XP-JEPA reduces rollout drift of a newly fitted predictor from $0.361$ to $0.104$ and increases mean control success from $53.6\%$ to $78.2\%$. Direct physical-state regression raises position decodability but leaves forecastability and control near the visual-only baseline. Cross-predictive physical grounding can therefore produce more forecastable latent dynamics for rollout-based control without privileged inputs at test time.

関連論文