何が起きたか

arXivに2026年8月18日付で掲載された論文「No Gaussian Required: Contrastive Inverse Dynamics for JEPA World Models」において、研究チームはJoint-Embedding Predictive Architectures (JEPAs)の表現崩壊を防ぐ新手法Action-Contrastive Masked Transition Modeling (AC-MTM)を提案した。AC-MTMは、既存のLeWorldModel (LeWM)の前方潜在予測目的を維持しつつ、訓練時のみ逆動力学ヘッドを追加し、Action-NCE損失で訓練する。この手法は、4つの標準的なピクセル制御タスクでSIGRegと同等の性能を示し、より難しいOGBench Visual Sceneタスクでは80.0±2.0%の成功率を達成し、SIGRegの58.0±2.0%を20〜24ポイント上回った。コードはhttps://github.com/jackboyla/action-contrastive-jepaで公開されている。

詳細

JEPAは将来の埋め込みを予測することで世界モデルを学習するが、その目的関数は定数エンコーダーという自明な解を持ち、すべての実用的なシステムは何らかの崩壊防止機構を追加している。LeWMはSIGRegと呼ばれる正則化子を用いて、潜在分布を等方性ガウス分布に一致させることで崩壊を防いでいる。これは、環境とは独立に表現の形を規定するアプローチである。 AC-MTMは、崩壊防止の圧力を遷移データ自体から得ることを提案する。具体的には、各潜在遷移がバッチ内の他のアクションの中から、それを生成したアクションを識別するという識別タスクを課す。崩壊したエンコーダーはこのタスクを失敗することが証明可能であり、これにより崩壊が防がれる。逆動力学ヘッドは訓練後に破棄され、テスト時のエンコーディング、前方予測、プランニング、計算量はLeWMと同一になる。 実験では、4つの標準的なピクセル制御タスクでAC-MTMはSIGRegと平均的に同等の性能を示した。OGBench Visual Sceneタスクでは、AC-MTMは80.0±2.0%の成功率を達成し、SIGRegの58.0±2.0%を上回った。また、50エピソードのランダムポリシーによる単一実行で52%のベースライン推定が得られた。AC-MTMは、ターゲットネットワーク、ストップグラデーション、事前学習済みエンコーダー、再構成目的を必要としない、分布に依存しない崩壊防止信号を提供する。

Key Facts

論文はarXivに2026年8月18日付で掲載された(arXiv:2608.17542v1)。[1]
AC-MTMはJEPAの崩壊防止に逆動力学ヘッドを訓練時のみ使用する。[1]
AC-MTMはOGBench Visual Sceneタスクで80.0±2.0%の成功率を達成し、SIGRegの58.0±2.0%を20〜24ポイント上回った。[1]
AC-MTMは4つの標準的なピクセル制御タスクでSIGRegと平均的に同等の性能を示した。[1]
50エピソードのランダムポリシーによる単一実行で52%のベースライン推定が得られた。[1]
AC-MTMはターゲットネットワーク、ストップグラデーション、事前学習済みエンコーダー、再構成目的を必要としない。[1]
コードはhttps://github.com/jackboyla/action-contrastive-jepaで公開されている。[1]

なぜ重要か

この研究は、JEPA世界モデルの崩壊防止に外部の正則化ではなく遷移データ自体を利用する新しいアプローチを示しており、より複雑なタスクで従来手法を上回る結果を示した。これにより、世界モデルの学習における表現崩壊問題に対する新たな解決策が提供される。