日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
世界モデルarXiv:2608.20065

直交JEPA:潜在世界モデルのための因子分解予測状態

Orthogonal JEPA: Factorized Predictive States for Latent World Models

シェア:XThreadsFacebookLINEはてブBluesky

標準的なJEPAの単一予測経路の問題を解決するため、直交因子分解により予測状態を複数成分に分割し、各成分を専用ブランチで予測する世界モデル学習フレームワークを提案した。

詳しい要約

1. どんなもの?

本論文は、複雑なシステムの潜在状態を学習するための新しいフレームワークであるOrthogonal JEPAを提案している。Joint-embedding predictive architectures (JEPAs) の一種であり、対象の状態を複数の直交成分に分解し、それぞれを専用の予測ブランチで予測することで、単一のターゲット埋め込みと単一の予測経路に依存する標準的なJEPAの限界を克服する。予測された成分は合成され、完全な潜在状態として、読み出し、デコーダ、プランナー、または自己回帰ロールアウトに使用できる。このメカニズムは、時間的未来、空間的隠れ、または同じシステムの部分観測など、さまざまなターゲットに適用可能である。

2. 先行研究と比べてどこがすごい?

標準的なJEPAは、すべての予測可能なコンテンツを単一のターゲット埋め込みと単一の予測経路に編成するため、複雑なシステムでは、支配的な信号に冗長な容量を割り当て、支配的でない予測構造への勾配が弱くなったり、矛盾したりする可能性がある。提案手法は、直交予測因子分解を導入することで、この問題に対処し、各ターゲット状態を複数の成分に分解し、それぞれを専用の予測ブランチで予測する。これにより、異なる予測構造が独立して学習され、冗長性が低減され、勾配の競合が緩和される。

3. 技術・手法の肝は?

手法の核心は、学習された基底行列を用いて各ターゲット状態を複数の成分に分析し、共有コンテキスト表現から各成分を推定する専用の予測ブランチを設けることである。予測回帰は、状態合成に必要な因子の大きさを維持し、直交性の目的関数は繰り返される方向を防ぎ、因子活動の正則化は投影されたターゲットの変動を維持し、オンライン分散正則化は座標方向のエンコーダ崩壊を防ぐ。予測された成分は合成され、完全な潜在状態を形成する。

4. どうやって有効だと検証した?

制御された視覚、単一細胞トランスクリプトミクス、縦断的健康記録、連続制御、分子動力学の実験を通じて、表現品質、予測、計画、長期的安定性を評価した。具体的な結果は要旨からは不明だが、これらの多様な領域での評価により、提案手法の有効性を検証している。

5. 議論はある?

要旨からは、提案手法の限界や潜在的な欠点についての議論は不明である。ただし、直交性の制約や因子活動の正則化など、ハイパーパラメータの調整が必要である可能性や、複雑なシステムでのスケーラビリティに関する議論が考えられるが、要旨には記載がない。

6. 次に読むべき論文は?

要旨で参照されている先行研究は明示されていないが、JEPAの基礎となる研究として、Yann LeCunらによるJEPA(Joint-Embedding Predictive Architecture)に関する論文が考えられる。また、世界モデルに関する研究(例: Dreamer, MuZero)や、表現学習における直交性の利用(例: Orthogonal Weight Normalization)も関連する。具体的には、要旨で比較されている標準的なJEPAの論文を読むことが推奨される。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Taoyong Cui, Pheng Ann Heng, Wanli Ouyang

分類: cs.LG

原文アブストラクト

World models construct latent states that support prediction, planning, and reasoning about an underlying system. Joint-embedding predictive architectures (JEPAs) offer a direct way to learn such states by predicting targets in representation space instead of reconstructing every detail of the observation. Standard JEPAs, however, organize all predictable content through one target embedding and one prediction pathway. In complex systems, this monolithic state can allocate redundant capacity to dominant signals while providing weak or conflicting gradients to less dominant predictive structure. We introduce \method, a latent world-modeling framework based on orthogonal predictive factorization. Learned basis matrices analyze each target state into multiple components, and a dedicated prediction branch estimates each component from a shared context representation. Predictive regression preserves the factor magnitudes required for state synthesis, an orthogonality objective discourages repeated directions, factor-activity regularization maintains variation in projected targets, and online variance regularization discourages coordinate-wise encoder collapse. Predicted components are synthesized into a complete latent state that can be used by a readout, decoder, planner, or autoregressive rollout. The same predictive-state mechanism applies when the target is temporally future, spatially hidden, or another partial observation of the same system. Experiments on controlled vision, single-cell transcriptomics, longitudinal health records, continuous control, and molecular dynamics evaluate representation quality, forecasting, planning, and long-horizon stability.

関連論文