何が起きたか
arXivは2026-09-28付で、LRC-JEPA: Disentangling Dynamics and Residual Context for Efficient World Modelsを公開した。論文は、計画に使う動的情報をコンパクトな潜在変数zに、時系列で残る文脈を残差文脈埋め込みuに分ける世界モデルを提案している。 著者らは、zのみを動力学モデルに通し計画に使い、uはクロスアテンションによる再構成に使う設計だと説明する。4つのシミュレーション制御環境では、同等規模のJEPA基準手法に対して平均計画成功率が9ポイント高く、Bridge-v2では5.5Mパラメータのアクティブエンコーダーがより大きいDINO-WM(22.1M)とV-JEPA2(303.9M)を上回った。
詳細
論文は、LRC-JEPAを「軽量なエンドツーエンド世界モデル」と位置づけ、学習されたクエリによる残差文脈埋め込みuを用いて、時間的に持続する情報を保持すると説明している。さらに、微分可能な残差接続を入れることで、潜在表現が動的内容を補完的に保持しやすくなるとしている。 評価では、4つのシミュレーション制御環境で、パラメータを合わせたJEPAベースラインより平均計画成功率が9ポイント改善した。また、実世界データセットBridge-v2では、5.5Mパラメータのactive encoderがDINO-WMの22.1M、V-JEPA2の303.9Mを上回り、計画速度も速いと記されている。物理状態プローブ、再構成介入、アブレーションも、この表現分離の有効性を裏づけたとしている。
Key Facts
| LRC-JEPAは、動的情報を潜在変数zに、残差文脈を埋め込みuに分ける世界モデルとして提案された。 | [1] |
| 論文は2026-09-28にarXivで公開された。 | [1] |
| 4つのシミュレーション制御環境で、同等規模のJEPA基準手法より平均計画成功率が9ポイント高かった。 | [1] |
| Bridge-v2では、5.5Mパラメータのactive encoderがDINO-WM(22.1M)とV-JEPA2(303.9M)を上回った。 | [1] |
| 著者らは、zのみを動力学モデルと計画に使い、uはクロスアテンション再構成に使うと説明している。 | [1] |
本紙の見方
LRC-JEPAの新規性は、世界モデルの表現を「計画に使う動的成分z」と「再構成に回す残差文脈u」に分離した点にある。単に小型化したモデルではなく、何を動かし、何を保持するかを構造として切り分けた設計であるため、既存のJEPA系が抱えやすい「可制御な状態」と「見た目の文脈」の混線を減らす狙いが明確だ。論文はこの分離が、シミュレーションでも実世界でも性能と速度の両方に効いたと主張している。 本紙の過去報道はないため、連続性の評価はできない。ただし、比較対象として挙げられているJEPA、DINO-WM、V-JEPA2の関係から見ると、今回の焦点は大規模化そのものではなく、少ないパラメータで計画に必要な表現を保つ設計にある。Bridge-v2で5.5Mのエンコーダーが22.1Mと303.9Mを上回ったという結果は、単純な規模競争よりも、表現の分担設計が性能差を生みうることを示唆する。 業界構造への含意は、ロボットや制御エージェントに必要な世界モデルが、画像再構成中心の表現学習から、計画用の状態抽出と文脈保持を分ける方向へ進む可能性にある。とくに、計画成功率と推論速度が同時に論点になる用途では、エンコーダーのサイズ削減だけでなく、学習された表現の役割分担が重要になる。もっとも、論文は4つのシミュレーション環境とBridge-v2での結果を示すにとどまり、制御対象の種類や汎化条件がどこまで広いかはまだ確認が必要である。 次に確認すべき点は、他の実環境タスクでも同様の分離が効くか、計画速度の改善幅がどの程度か、そしてzとuの分離が学習データの構成にどれだけ依存するかである。特に、Bridge-v2以外の実ロボットや長期タスクで、同じ5.5M規模の設計が再現するかが焦点になる。
なぜ重要か
論文が示したのは、5.5Mパラメータのエンコーダーでも、より大きい22.1Mや303.9Mの比較対象を上回りうるという点である。計画に必要な表現を分離できれば、世界モデルの計算量と推論速度の両方を抑えられる可能性がある。
日本への影響
日本では、ロボット制御や実機学習で限られた計算資源をどう配分するかが論点になりやすい。今回の結果は、表現の分離が実機向け世界モデルの設計条件になりうることを示しており、計算資源を大きくできない研究開発にとっては示唆がある。