何が起きたか

arXivに投稿された論文(識別子:2608.10824v1)で、VLAモデルのKVキャッシュ再利用を適応的に制御する手法「Gated VLA-Cache」が提案された。VLAモデルはカメラ画像と言語指示を単一の自己回帰トランスフォーマーでモーターコマンドに直接マッピングするが、隣接フレームでほとんど変化しない視覚トークンのKV表現を再計算するため計算コストがかかる。既存のVLA-Cacheは視覚的に静的パッチのKV状態を再利用するが、観測空間のヒューリスティックのみに依存し、モデル自身の不確実性を考慮しない。提案手法は、視覚的類似性キャッシュに神経内省を追加する軽量でトレーニング不要の拡張であり、デコード中に利用可能なゼロコストの信頼度信号として、上位2つの予測アクショントークン間のロジットマージンを監視する。マージンが閾値を下回るとキャッシュを無効化し、完全な再計算をトリガーする。OpenVLAとOpenVLA-OFTの両方を用いた4つのLIBEROベンチマークスイートでの評価では、盲目的キャッシュが害を及ぼす場合に信頼性を向上させた。LIBERO-GoalとLIBERO-Longでは、失われた精度の100%以上を回復しつつ、計算削減の80%を維持したと報告されている。

Key Facts

VLAモデルはカメラ画像と言語指示を単一の自己回帰トランスフォーマーでモーターコマンドに直接マッピングする。[0]
既存のVLA-Cacheは視覚的に静的パッチのKV状態を再利用するが、観測空間のヒューリスティックのみに依存し、モデル自身の不確実性を考慮しない。[0]
提案手法「Gated VLA-Cache」は、視覚的類似性キャッシュに神経内省を追加する軽量でトレーニング不要の拡張である。[0]
この手法は、デコード中に利用可能なゼロコストの信頼度信号として、上位2つの予測アクショントークン間のロジットマージンを監視する。[0]
マージンが閾値を下回るとキャッシュを無効化し、完全な再計算をトリガーする。[0]
OpenVLAとOpenVLA-OFTの両方を用いた4つのLIBEROベンチマークスイートでの評価では、盲目的キャッシュが害を及ぼす場合に信頼性を向上させた。[0]
LIBERO-GoalとLIBERO-Longでは、失われた精度の100%以上を回復しつつ、計算削減の80%を維持した。[0]

なぜ重要か

VLAモデルは実時間制御での計算コストが課題であり、KVキャッシュ再利用はその削減に有効だが、視覚的類似性のみに依存すると精度が低下する場合がある。提案手法はモデル自身の不確実性を考慮することで、精度と計算効率のトレードオフを改善する可能性を示しており、ロボット制御などの実時間応用への貢献が期待される。