何が起きたか
arXivに2026-09-16付で掲載された論文「FIVE-VLA」は、自動運転向けのVLAモデルについて、641Mパラメータの構成で高解像度の448×896画像を98トークンに圧縮して扱う手法を示した。論文は、単発の軌道予測ではテキスト生成を介さず、過去の行動トークンを参照するRecurrent Action Memoryを組み合わせることで、時系列情報を反映させる設計だとしている。
詳細
論文は、既存手法より5倍超少ない98トークンで高解像度画像を処理し、単発のtrajectory predictionではテキスト生成を省いている。Recurrent Action Memoryは、追い越しや緊急ブレーキのような操作で重要な過去の行動履歴を条件に加える軽量モジュールとして説明されている。 評価では、難度の高いBench2Drive閉ループベンチマークで、従来のstate-of-the-art VLAより交通ルール違反のないルート完了率が約10%高かったとしている。また、NVIDIA Physical AI AVデータセット上の非反応的なopen-loopシミュレーションでは、SimLingo比で単一視点で10.2%、4視点で7.7%低いcollision-violation率を示した。推論速度はA100 GPUで約30fps、T4 GPUで約4fpsで、既存手法に対して8〜30倍の高速化だとしている。
Key Facts
| 論文名は「FIVE-VLA: Fast and EffectIVE Autonomous Driving with Recurrent Action Memory」である | [1] |
| 掲載日は2026-09-16で、掲載先はarXivである | [1] |
| モデルは641M parametersである | [1] |
| 高解像度の448×896画像を98 tokensで処理し、既存手法より5倍超少ないとされる | [1] |
| A100 GPUで約30 fps、T4 GPUで約4 fpsで動作し、8〜30倍のspeedupだとしている | [1] |
本紙の見方
今回の論文の新規性は、単に自動運転向けVLAの精度を示した点ではなく、入力画像の処理効率と行動履歴の持たせ方を同時に詰めている点にある。448×896という高解像度を98トークンで扱い、しかも単発の軌道予測ではテキスト生成を省く設計は、VLAを大きく重くしがちな従来構成への明確な反証材料になる。一方で、Recurrent Action Memoryは「長期記憶」というより、前回の行動トークンを条件に入れる軽量な時系列補助であり、記憶の付与を最小限の計算で実現しようとしていると読める。 本紙の見方としては、焦点は「自動運転の理解能力」そのものより、閉ループで使える速度と安定性をどこまで両立できるかに移っている。Bench2Driveで約10%多くルール違反なしのルートを完了したという結果は、単純なオープンループ評価よりも実車制御に近い条件での設計意図を示す。ただし、論文が示すのはあくまでベンチマークとシミュレーション上の成績であり、実車搭載時の遅延、センサ構成、計算資源の制約下で同じ挙動が出るかは別問題である。A100とT4でのfps差が示す通り、性能はGPU種別に強く依存するため、エッジ相当での4fpsがどの走行条件まで許容されるかが次の論点になる。 VLAは画像、時系列、行動出力を一体で扱うため、モデル規模が膨らむほど車載実装のハードルが上がる。FIVE-VLAは、画像トークン数の削減と行動メモリの分離によって、そのボトルネックを緩める方向を示したといえる。もっとも、残る確認点は、学習データの範囲、評価条件の違い、どの程度の視野数で性能が維持されるか、そして実機の制御遅延を含めた安全性である。
なぜ重要か
論文が示すように、FIVE-VLAは高解像度画像を98トークンに圧縮しながら、Bench2Driveで従来手法より約10%多くルートを完了し、A100で約30fps、T4で約4fpsを示した。これは、自動運転向けVLAを研究段階から実装段階へ近づける際に、計算量と時系列記憶の両方をどう抑えるかという課題に直接関係する。
日本への影響
日本では、車載計算資源が限られる前提で自動運転向けAIを組み込む場合、この論文が示すような98トークン処理やA100/T4での速度差が設計条件になる可能性がある。特に、実機での遅延と安全性を重視する自動車開発では、モデル規模を抑えつつ過去の行動を参照する方式がどこまで有効かが検討対象になりうる。