何が起きたか

arxiv.orgは2026-09-24、WALT(Learning World-Model-Aligned Latent Trajectories for Autonomous Driving)を公表した。WALTは、凍結した事前学習済みの走行世界モデルを変えずに、その知識をデュアルブランチのtrajectory autoencoderを通じて潜在的な軌道空間へ移す手法である。評価ではNAVSIMv1でPDMSが89.4から89.8、NAVSIMv2でEPDMSが87.3から87.9に向上し、trajectory plannerのFLOPsは30.5%減少した。

詳細

論文は、視覚的な世界状態と生の幾何学的な軌道との不一致が、計画器が世界モデル内の行動関連セマンティクスを使う妨げになりうると整理する。その解決策として、WALTは生のwaypointを直接生成するのではなく、デュアルブランチのtrajectory autoencoderでコンパクトな表現に写像し、凍結した視覚世界モデルから意味情報を転移する。論文ではさらに、Joint-Embedding Predictive Architectures(JEPA)に基づく潜在学習と、Representation Alignment(REPA)に沿った特徴整列も系統的に検討している。

Key Facts

WALTは「Learning World-Model-Aligned Latent Trajectories for Autonomous Driving」という題名の研究である。[1]
提案手法は、凍結した事前学習済みの走行世界モデルを変更せずに知識を転移する。[1]
trajectory autoencoderはデュアルブランチ構成で、waypointをコンパクトな潜在表現に変換する。[1]
NAVSIMv1でPDMSは89.4から89.8に改善した。[1]
NAVSIMv2でEPDMSは87.3から87.9に改善し、trajectory plannerのFLOPsは30.5%減少した。[1]

本紙の見方

WALTの新規性は、走行世界モデルの視覚表現をそのまま使うのではなく、そこから行動に必要な情報だけを軌道用の潜在空間へ写し替える点にある。既定路線の延長としては、世界モデルを計画に使う発想自体は珍しくないが、この論文は世界モデル本体を凍結したまま、軌道側の表現設計で計画性能と計算量を同時に扱っている。したがって焦点は「世界モデルをどう大きくするか」ではなく、「世界モデルと軌道表現のインターフェースをどう設計するか」に移っている。 本紙の関連記事はないため、ここでは本研究の内部整合性だけを見ると、評価指標の改善幅は大きくない一方で、FLOPs削減が30.5%と明示されている点が重要である。NAVSIMv1のPDMSは89.4から89.8、NAVSIMv2のEPDMSは87.3から87.9で、性能改善は限定的だが、計算効率の改善が併記されているため、研究の主眼は性能単独ではなく、推論時の負荷を抑えながら計画に必要な表現を保つことにあると読める。 業界構造でみると、この手法は自動運転スタックの中でも、認識と制御の間にある計画層の表現圧縮に効く。世界モデルの出力をそのまま下流に流すのではなく、trajectory autoencoderで潜在化するため、入力側の視覚表現、計画器、計算資源の三者をつなぐ中間表現の設計が競争領域になる。さらにJEPAやREPAを比較対象に入れているため、将来の論点は、軌道のみで学習した表現が実運転の多様なシーンでどこまで汎化するか、また凍結した世界モデルの選び方で結果がどう変わるかに移るとみられる。 未確定の論点は、NAVSIM以外のベンチマークでの再現性、実車データでの有効性、そして30.5%のFLOPs削減がどの構成要素に由来するかである。論文は計画器の計算量削減を示すが、学習データ規模、推論遅延、失敗ケース、車両制御への接続条件までは本文からは読み切れない。

なぜ重要か

WALTは、走行世界モデルを壊さずに下流の軌道表現だけを圧縮するため、計画層の計算負荷を下げながら性能を保つ設計を示した点に意味がある。研究発表では、NAVSIMv1でPDMS 89.4→89.8、NAVSIMv2でEPDMS 87.3→87.9、FLOPs 30.5%減が示されており、計画器の効率化を重視する開発に関係する。