日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
自動運転arXiv:2608.20890

VLAベースのエンドツーエンド自動運転のための協調的マルチモーダル相互作用

A Collaborative Multi-Modality Interaction for VLA-based End-to-End Autonomous Driving

シェア:XThreadsFacebookLINEはてブBluesky

VLAモデルを用いた自動運転において、異種センサ間の効果的なマルチモーダル相互作用と複数軌道計画を統合し、安全性と解釈可能性を向上させるシステムを提案した。

詳しい要約

1. どんなもの?

本論文は、Vision-Language-Action (VLA) モデルに基づくエンドツーエンド自動運転システムを提案している。既存のVLAモデルは自動運転をvisual question answeringタスクとして定式化するため、意思決定の推論が信頼性に欠け解釈性が低い。また、異種センサー間の効果的なマルチモーダル相互作用を確立できず、長尾シナリオでのロバストなシーン認識と運転推論が制限される。提案システムは、マルチモダリティ相互作用とマルチ軌道計画・最適化を組み合わせ、より信頼性が高く解釈可能で安全な運転判断を実現する。

2. 先行研究と比べてどこがすごい?

先行研究のVLAモデルは、主に視覚と言語の統合に焦点を当て、自動運転をVQAタスクとして扱うため、推論の解釈性や信頼性が不足していた。また、異種センサー(例:カメラ、LiDAR)間の相互作用を効果的に扱えず、長尾シナリオでの性能が限定的だった。本提案は、Affinity-Guided Optimal Transportによる主・補助モダリティの双方向相互作用、Distribution-Consistent Modality Transferによる異種モダリティの分布転送とクロスモーダル相互作用、さらにマルチモーダル・マルチ軌道計画と知覚指向軌道リファインメントを導入し、これらの問題を解決している点が優れている。

3. 技術・手法の肝は?

手法の核は3つのコンポーネントから成る。(1) Affinity-Guided Optimal Transport: 主モダリティと補助モダリティ間の双方向相互作用を最適輸送理論に基づき実現し、モダリティ間の関連性を考慮した特徴統合を行う。(2) Distribution-Consistent Modality Transfer: 異種モダリティ間の分布の不一致を調整し、クロスモーダルな情報転送を効果的に行う。(3) Multi-modal Multi-Trajectory Planning: 複数のモダリティ情報を統合して複数の軌道候補を生成し、Perception-Oriented Trajectory Refinementにより知覚情報を考慮して軌道を洗練し、長尾シナリオでの運転判断を改善する。

4. どうやって有効だと検証した?

オープンループおよびクローズドループのデータセットを用いて実験を行い、安全性、長期的な運転推論、道路シーン認識の観点で既存の運転システムと比較して改善を示した。具体的なデータセット名や評価指標は要旨からは不明だが、提案手法の有効性を定量的に検証している。

5. 議論はある?

要旨からは、提案手法が長尾シナリオでの性能向上を示す一方で、計算コストや実世界での実装可能性、他のセンサー構成への一般化などについての議論は明示されていない。また、マルチモーダル相互作用の設計がどの程度解釈性を向上させるかについての詳細な分析も要旨からは不明。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、VLAモデルを用いたエンドツーエンド自動運転の既存研究(例:VQAベースのアプローチ)や、マルチモーダル相互作用のためのOptimal TransportやModality Transferに関する研究が挙げられる。具体的な論文名は要旨にないため、同分野の定番として、Vision-Language-Actionモデルに関するサーベイや、マルチモーダル学習の基礎論文(例:CLIP, ALIGN)を読むことが推奨される。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Jingtao Sun, Xiaohai He, Yike Zhang, Dong Huang, Yaonan Wang, Ajmal Mian, Mike Zheng Shou

分類: cs.CV, cs.RO

原文アブストラクト

Vision-Language-Action (VLA) models have emerged as a powerful paradigm for end-to-end autonomous driving by jointly integrating perception, reasoning, and decision making within a unified multimodal framework. However, most existing VLA models formulate end-to-end autonomous driving as a visual question answering task, leading to unreliable and less interpretable decision reasoning. In addition, they fail to establish effective multi-modal interaction across heterogeneous sensors, thereby limiting robust scene perception and reliable driving reasoning in long-tail driving scenarios. To this end, we propose a robust VLA-based end-to-end autonomous driving system that combines multi-modality interaction with multi-trajectory planning and optimization, enabling more reliable, interpretable, and safer driving decisions. Our method comprises three core components: (1) Affinity-Guided Optimal Transport for main-auxiliary modality two-way interaction; (2) Distribution-Consistent Modality Transfer for heterogeneous modality distribution transfer and cross-modal interaction; (3) Multi-modal Multi-Trajectory Planning along with Perception-Oriented Trajectory Refinement for better driving decisions to long-tail driving scenarios. Experimental results in open-loop and closed-loop datasets demonstrate improvements in safety long-horizon driving reasoning and road scene perception over existing driving systems, highlighting the ability of our mutli-modality interaction and multi-trajectory planning and optimization for scalable VLA-based systems.

関連論文