何が起きたか
arXivに投稿された論文(識別子:2608.10824v1)で、VLAモデルのKVキャッシュ再利用を適応的に制御する手法「Gated VLA-Cache」が提案された。VLAモデルはカメラ画像と言語指示を単一の自己回帰トランスフォーマーでモーターコマンドに直接マッピングするが、隣接フレームでほとんど変化しない視覚トークンのKV表現を再計算するため計算コストがかかる。既存のVLA-Cacheは視覚的に静的パッチのKV状態を再利用するが、観測空間のヒューリスティックのみに依存し、モデル自身の不確実性を考慮しない。提案手法は、視覚的類似性キャッシュに神経内省を追加する軽量でトレーニング不要の拡張であり、デコード中に利用可能なゼロコストの信頼度信号として、上位2つの予測アクショントークン間のロジットマージンを監視する。マージンが閾値を下回るとキャッシュを無効化し、完全な再計算をトリガーする。OpenVLAとOpenVLA-OFTの両方を用いた4つのLIBEROベンチマークスイートでの評価では、盲目的キャッシュが害を及ぼす場合に信頼性を向上させた。LIBERO-GoalとLIBERO-Longでは、失われた精度の100%以上を回復しつつ、計算削減の80%を維持したと報告されている。
Key Facts
| VLAモデルはカメラ画像と言語指示を単一の自己回帰トランスフォーマーでモーターコマンドに直接マッピングする。 | [0] |
| 既存のVLA-Cacheは視覚的に静的パッチのKV状態を再利用するが、観測空間のヒューリスティックのみに依存し、モデル自身の不確実性を考慮しない。 | [0] |
| 提案手法「Gated VLA-Cache」は、視覚的類似性キャッシュに神経内省を追加する軽量でトレーニング不要の拡張である。 | [0] |
| この手法は、デコード中に利用可能なゼロコストの信頼度信号として、上位2つの予測アクショントークン間のロジットマージンを監視する。 | [0] |
| マージンが閾値を下回るとキャッシュを無効化し、完全な再計算をトリガーする。 | [0] |
| OpenVLAとOpenVLA-OFTの両方を用いた4つのLIBEROベンチマークスイートでの評価では、盲目的キャッシュが害を及ぼす場合に信頼性を向上させた。 | [0] |
| LIBERO-GoalとLIBERO-Longでは、失われた精度の100%以上を回復しつつ、計算削減の80%を維持した。 | [0] |
なぜ重要か
VLAモデルは実時間制御での計算コストが課題であり、KVキャッシュ再利用はその削減に有効だが、視覚的類似性のみに依存すると精度が低下する場合がある。提案手法はモデル自身の不確実性を考慮することで、精度と計算効率のトレードオフを改善する可能性を示しており、ロボット制御などの実時間応用への貢献が期待される。