何が起きたか

arXivに公開された論文(ID: 2608.07361v1)で、運転用のVision-Language-Action(VLA)モデルにおける計画トークンの層ごとの解析と刈り込みが報告された。研究チームは、計画全体を単一の計画トークンが担う代表的な運転VLAモデルを対象に、32個のデコーダ層それぞれから計画トークンをデコードし、ナビゲーションコマンドの線形デコード可能性と、凍結されたネイティブプランナーとの軌道互換性を測定した。その結果、意味的意図は初期層で線形デコード可能であり、コマンドプローブ精度は最初のデコーダ層後に97.7%に達した(チャンスレベルは16.7%)。一方、凍結プランナーとの互換性は深さとともに徐々に改善し、オープンループのAvg-L2は最終層でのみ最小値2.11mに達した。最初の層からの学習済みリードアウトはこのギャップの多くを回復し、計画情報は初期に存在するが、配備されたプランナーが期待する形式ではまだ表現されていないことを示した。計画トークンに誘発される角度偏差でデコーダ層をランク付けすることで、32層中8層を削除してもオープンループ誤差の相対的な増加は約5%に留まり、デコーダの速度は1.33倍に向上した。評価したサンプルサイズでは、ファミリー固有の劣化は統計的に確認されなかった。

Key Facts

研究対象は、計画全体を単一の計画トークンが担う運転用VLAモデルである。[0]
コマンドプローブ精度は最初のデコーダ層後に97.7%に達し、チャンスレベルは16.7%だった。[0]
オープンループのAvg-L2は最終層でのみ最小値2.11mに達した。[0]
32層中8層を削除した場合、オープンループ誤差の相対的な増加は約5%で、デコーダ速度は1.33倍に向上した。[0]
評価したサンプルサイズでは、ファミリー固有の劣化は統計的に確認されなかった。[0]
この研究は、評価されたORIONチェックポイントとBench2Drive設定に限定される。[0]

なぜ重要か

この研究は、運転用VLAモデルの内部表現の理解を深め、モデル圧縮の可能性を示すものである。計画情報が初期層に存在することを示すことで、効率的な推論のための層刈り込みの指針を提供する。ただし、結果は特定のモデルと設定に限定されており、一般化にはさらなる検証が必要である。