日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
自動運転arXiv:2609.04070v1

離散的な心から連続的な行動へ:エンドツーエンド自動運転のための潜在整合プランニング

Continuous Actions from Discrete Minds: Latent-Aligned Planning for End-to-End Autonomous Driving

シェア:XThreadsFacebookLINEはてブBluesky

Vision-Language Modelの離散的な推論と自動運転の連続的な物理制約を橋渡しするため、潜在整合プランニングを備えたVLAフレームワークLaPlaを提案。量子化誤差を排除し、物理的に妥当な軌道を生成する。

詳しい要約

1. どんなもの?

本論文は、Vision-Language Modelの離散的な推論と自動運転の連続的かつ物理的制約のある動作の間のギャップを埋めるため、潜在整列計画(latent-aligned planning)を備えた統合Vision-Language-Action (VLA)フレームワークであるLaPlaを提案する。LaPlaは、残差ベクトル量子化変分オートエンコーダ(VQ-VAE)に基づくアクショントークナイザを設計し、車両の運動学を捉え、軌道特徴を構造化された潜在空間に符号化する。離散的なコードブック参照による量子化誤差を避けるため、この表現を物理的先行知識として利用し、高次元の意味論と生のアクション空間の間のモダリティギャップを橋渡しする。マルチビュー画像、履歴アクション、テキスト指示を統合したマルチモーダル入力が与えられると、LaPlaは並行アクションクエリを組み込み、単一のフォワードパスでマルチモーダルコンテキストに因果的に注意を向け、隠れ状態を事前学習済みのVQ-VAE潜在空間に直接投影する。凍結されたデコーダはこれらの連続潜在表現をアクションに変換し、量子化誤差を排除し、物理的に妥…

2. 先行研究と比べてどこがすごい?

先行研究のVLA手法は、離散的なコードブック参照を用いることで量子化誤差を生じ、自己回帰生成による時間的コストが高いという問題があった。LaPlaは、VQ-VAEの潜在空間を物理的先行知識として再利用し、連続潜在表現を直接デコードすることで量子化誤差を排除し、自己回帰生成を回避して推論遅延を大幅に削減する点が優れている。また、並行アクションクエリにより単一フォワードパスでマルチモーダルコンテキストを処理し、効率的な動作生成を実現する。

3. 技術・手法の肝は?

手法の肝は、残差VQ-VAEに基づくアクショントークナイザを設計し、車両の運動学を捉えた軌道特徴を構造化潜在空間に符号化すること。そして、この潜在空間を物理的先行知識として利用し、マルチモーダル入力(マルチビュー画像、履歴アクション、テキスト指示)に対して並行アクションクエリを因果的に注意させ、隠れ状態を事前学習済みのVQ-VAE潜在空間に直接投影する。凍結されたデコーダが連続潜在表現をアクションに変換することで、量子化誤差を排除し、物理的に妥当な軌道を生成する。自己回帰生成を回避し、単一フォワードパスで動作を生成する点も重要。

4. どうやって有効だと検証した?

nuScenesベンチマークでのオープンループ評価において、最先端のVLA手法と比較して長期的なL2エラーを15.52%削減し、競争力のある性能を達成した。また、NVIDIA AlpaSimシミュレータでのクローズドループ評価では、成功率を33.34パーセンテージポイント向上させ、推論遅延を大幅に削減し、スムーズな運転進行を実現することを確認した。

5. 議論はある?

要旨からは、提案手法の限界や潜在的な問題についての議論は不明である。ただし、オープンループ評価とクローズドループ評価の両方で有効性を示しているが、実世界の複雑なシナリオでの性能や、他のデータセットでの汎用性については言及されていない。また、VQ-VAEの潜在空間の解釈性や、物理的先行知識としての妥当性についての詳細な分析は要旨には含まれていない。

6. 次に読むべき論文は?

要旨で参照されている研究は、Vision-Language-Action (VLA)モデル、VQ-VAE、nuScenesベンチマーク、NVIDIA AlpaSimシミュレータなどである。次に読むべき論文としては、VLAの基盤となるVision-Language Modelの研究や、自動運転における行動計画のための自己回帰生成モデル、あるいはVQ-VAEの応用に関する論文が考えられる。具体的には、要旨で比較された最先端のVLA手法の論文や、nuScenesデータセットを用いた他の行動予測手法の論文が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Ruoyu Yao, Yusen Xie, Qingzhao Liu, Pei Liu, Zewei Yang, Yipeng Zhu, Xiaolong Wang, Jun Ma

分類: cs.CV, cs.RO

原文アブストラクト

Bridging the gap between the discrete reasoning of Vision-Language Models and the continuous, physics-constrained nature of autonomous driving remains a significant challenge. In this work, we introduce LaPla, a unified Vision-Language-Action (VLA) framework featuring latent-aligned planning to seamlessly ground semantic understanding in precise motion execution. We first design an action tokenizer based on a residual vector-quantized variational autoencoder (VQ-VAE), capturing vehicle kinematics and encoding trajectory features into a structured latent space. Rather than discrete codebook lookups that inevitably introduce quantization errors, LaPla repurposes this representation as a physical prior to bridge the modality gap between high-dimensional semantics and the raw action space. Specifically, given multimodal inputs integrating multi-view images, historical actions, and textual instructions, LaPla incorporates concurrent action queries to causally attend to the multimodal context in a single forward pass, projecting hidden states directly into the pretrained VQ-VAE latent space. The frozen decoder then translates these continuous latents into actions, effectively eliminating quantization errors and ensuring physically plausible trajectories while bypassing time-consuming autoregressive generation. Extensive experiments on the nuScenes benchmark demonstrate that LaPla achieves competitive open-loop performance, reducing long-horizon L2 error by 15.52% compared to state-of-the-art VLA methods. Closed-loop evaluations on the NVIDIA AlpaSim simulator further confirm its superior capability in ensuring smooth driving progress, improving the success rate by 33.34 percentage points with significantly reduced inference latency.

関連論文