何が起きたか

2026年5月17日にarXivで公開された論文で、Vision-Language-Action (VLA)モデルを用いたエンドツーエンド自動運転向けの適応フレームワークCLAPが発表された。CLAPは、凍結したVLAモデルに道路ブロックごとのソフトプロンプトを追加し、V2X通信でオンデマンドに取得する。NAVSIMベンチマークで、困難シナリオの計画誤差を24%削減し、通常フレームでは性能低下なしと報告された。

詳細

CLAPは、VLAモデルの潜在空間における観察に基づく。同一道路ブロックのシナリオは潜在空間で密にクラスタリングし、長尾と通常フレームは混在するため、一方を改善すると他方を乱す可能性がある。CLAPは、教師あり対比学習で道路ブロック固有のハードシナリオ方向を発見し、方向正則化付きプロンプト最適化で困難フレームを選択的に改善する2段階パイプラインを採用する。NAVSIMベンチマークで、複数の最先端VLAバックボーンに対して、困難シナリオの計画誤差を24%削減し、通常フレームでは回帰なしと報告された。

Key Facts

CLAPは、凍結したVLA駆動モデルに道路ブロックごとのソフトプロンプトを追加する適応フレームワークである。[1]
CLAPは、V2X通信を介してクラウドソースデータからプロンプトをオンデマンドで取得する。[1]
CLAPは、教師あり対比学習と方向正則化付きプロンプト最適化の2段階パイプラインを採用する。[1]
NAVSIMベンチマークで、CLAPは困難シナリオの計画誤差を24%削減し、通常フレームでは回帰なしと報告された。[1]

なぜ重要か

自動運転の実用化には、まれな長尾シナリオへの対応が不可欠だが、データ収集やモデル再訓練はコストが高い。CLAPは、既存のVLAモデルを凍結したままプロンプトで適応するため、効率的な長尾対応の可能性を示す。ただし、実環境での有効性やV2Xインフラへの依存が課題であり、今後の実証が注目される。