何が起きたか

VLAモデルはカメラ画像と言語指示を直接モーターコマンドにマッピングするが、リアルタイム制御ではKV状態の再計算に多くの計算資源を費やす。本研究は、VLA-Cacheを拡張し、トレーニング不要のニューラル内省ゲートを導入する。このゲートは、デコーディング中の平均トップ1/トップ2ロジットマージンを監視し、閾値を下回るとキャッシュを無効化して全再計算を行う。それ以外は、標準のパッチ類似度とレイヤー単位の再利用パイプラインを進める。LIBEROベンチマークスイートでOpenVLAとOpenVLA-OFTを用いて評価し、盲目的キャッシュが精度を損なう場合に信頼性を向上させるとしている。

Key Facts

VLAモデルはカメラ画像と言語指示を直接モーターコマンドにマッピングするが、リアルタイム制御ではKV状態の再計算に多くの計算資源を費やす。[0]
本研究はVLA-Cacheを拡張し、トレーニング不要のニューラル内省ゲートを導入する。[0]
ゲートはデコーディング中の平均トップ1/トップ2ロジットマージンを監視し、閾値を下回るとキャッシュを無効化して全再計算を行う。[0]
それ以外は、標準のパッチ類似度とレイヤー単位の再利用パイプラインを進める。[0]
LIBEROベンチマークスイートでOpenVLAとOpenVLA-OFTを用いて評価し、盲目的キャッシュが精度を損なう場合に信頼性を向上させるとしている。[0]
LIBERO-GoalとLIBERO-Longでは、VLA-Cacheが失った精度を回復しつつ、計算コストの削減の大部分を維持するとしている。[0]

なぜ重要か

VLAモデルはロボット制御において有望だが、推論コストが高い。このゲート手法は、モデルの不確実性に基づいてキャッシュを無効化することで、精度を保ちながら計算コストを削減できる可能性を示している。特に、長期的なタスクや目標指向のタスクで盲目的キャッシュが精度を損なう場合に有効とされる。