何が起きたか

arXivは2026-09-28、論文「AD-E2E-JEPA: A Joint-Embedding Predictive Architecture For End-to-End Autonomous Driving」を掲載した。著者らは、既存のJEPA系世界モデルをE2E自動運転向けに評価し直したうえで、SIGRegで正則化した学習可能プロジェクタを導入する手法を提案した。計画パッチ数を16倍削減し、埋め込み次元を4分の1にしながら、推論速度を100倍にしたとしている。

詳細

論文は、LeWM、DINO-WM、JEPA-WMを含む既存のaction-conditioned JEPA world modelsを、まずE2E自動運転向けに体系評価したと述べる。そのうえで、目標条件付きゼロショット計画の設定を用い、方策学習を行わずに、将来観測を目標として世界モデル自体を評価した。著者らは、8フレームのロールアウトで256候補軌道を扱う場合に0.8秒で推論できたとしている。 性能面では、trajectory vocabularies 256/8,192 candidates を用いた評価で、平均4.0/2.8メートルの到達ずれの範囲で、20メートル先の目標に到達したと説明している。NAVSIMv2 benchmarkでは、multiplicative safety metrics付きで67.3/72.9 EPDMS、同指標なしで84.1/86.5 EPDMS$^{\dagger}$を示したとしている。さらに、自己教師あり事前学習のプロジェクタが模倣学習の性能を80.2から85.4 EPDMSへ改善したとしている。

Key Facts

論文名は「AD-E2E-JEPA: A Joint-Embedding Predictive Architecture For End-to-End Autonomous Driving」である。[1]
掲載日は2026-09-28で、媒体はarXivである。[1]
提案手法はSIGRegで正則化した学習可能プロジェクタを用いる。[1]
計画パッチ数を16分の1、埋め込み次元を4分の1にし、推論速度を100倍にしたとしている。[1]
8フレームのロールアウトで256候補軌道を扱う場合、0.8秒の推論時間を示したとしている。[1]

本紙の見方

本稿の焦点は、E2E自動運転の性能向上そのものより、世界モデルの計算負荷と計画性能の両立にある。著者らは既存のJEPA系世界モデルをLeWM、DINO-WM、JEPA-WMまで含めて評価したうえで、計画パッチ数を16分の1、埋め込み次元を4分の1に圧縮しながら、推論速度を100倍にしたと主張している。ここで新しいのは、単なる精度改善ではなく、ゼロショット計画に使える水準を保ったまま推論コストを下げる設計を前面に出している点である。 一方で、これは完全に新しい問題設定というより、既存の世界モデル比較を踏まえた延長線上にある。論文は方策学習を切り離し、将来観測を目標にする goal-conditioned zero-shot planning で評価しているため、モデル自体の計画能力を測る構成は比較的明快である。ただし、その結果が実車の閉ループ運転や異なる走行環境にどこまで移るかは、この論文だけでは確定しない。NAVSIMv2でのEPDMSや安全指標は示されているが、運転スタック全体の性能ではなく、世界モデル層の指標である点を切り分けて読む必要がある。 構造面では、入力観測からパッチ化し、プロジェクタで次元を圧縮し、候補軌道を評価して目標到達を選ぶ流れが見える。16倍のパッチ削減と4倍の次元削減は、単にモデルを小さくしたというより、計画段階の探索空間を絞り込む設計であり、0.8秒という推論時間の意味もここにある。したがって、業界への含意は、E2E自動運転が大規模モデルの精度競争だけでなく、実時間で回る計画表現の設計競争に移りつつあることだとみられる。 未確定の論点は、まず同手法が学習済みプロジェクタ以外の構成要素を含めてどこまで一般化するかである。次に、NAVSIMv2以外のベンチマークや長時間の走行で同じ速度・精度の両立が維持できるか、また8フレーム以外のロールアウトで計算量がどう変わるかが焦点になる。加えて、論文はソースコード公開を示しているが、実装の再現性や計算資源要件の詳細は本文からは読み切れない。

なぜ重要か

この論文が示すのは、自動運転で世界モデルを使う際に、計画精度だけでなく推論時間が主要な制約になるという点である。著者らは8フレーム・256候補軌道で0.8秒とし、推論速度を100倍にしたとしているため、実時間計画に近い条件での使い勝手が論点になる。

日本への影響

日本の自動運転関連研究や車載計算では、モデル精度だけでなく実時間推論と探索空間の圧縮がより重要になる可能性がある。特に、車載向けに計算資源が限られる前提では、16分の1のパッチ削減や4分の1の埋め込み次元といった設計思想が、評価指標の見方に影響するとみられる。