何が起きたか

研究チームは2025年2月4日、arxiv.orgで「VLA-Cache: Efficient Vision-Language-Action Manipulation via Adaptive Token Caching」を公開した。VLA-Cacheは、VLAモデルの推論時に静的視覚トークンを適応的にキャッシュ・再利用することで計算負荷を減らす。実験では、LIBEROとSIMPLERの2つのシミュレーションプラットフォームと実ロボットシステムで、CUDAレイテンシを最大1.7倍高速化し、制御周波数を15%向上させた。

詳細

VLA-Cacheは、ロボット操作の時間的連続性を利用し、隣接フレーム間で変化が最小のトークンを特定して、そのキー・バリュー表現を再利用する。これにより冗長な計算を回避する。さらに、環境に敏感なタスク関連トークンは選択的に再計算し、行動精度を維持する。また、デコーダ層の注意集中に基づいて再利用比率を動的に調整する層適応型トークン再利用戦略を導入している。実験では、タスク成功率の損失は無視できる程度だった。

Key Facts

VLA-Cacheは、学習不要の推論高速化手法であり、静的視覚トークンを適応的にキャッシュ・再利用する。[1]
LIBEROとSIMPLERの2つのシミュレーションプラットフォームと実ロボットシステムで実験を行った。[1]
CUDAレイテンシで最大1.7倍の高速化、制御周波数で15%の向上を達成した。[1]
タスク成功率の損失は無視できる程度である。[1]
コードと動画はプロジェクトページ(https://vla-cache.github.io)で公開されている。[1]

なぜ重要か

VLA-Cacheは、ロボット操作におけるVLAモデルの実用化を後押しする可能性がある。計算コストの削減は、エッジデバイスでの展開や応答性の向上につながり、産業用ロボットやサービスロボットの性能向上に寄与し得る。また、学習不要のアプローチは、モデル更新の頻度を減らし、導入コストを抑える点で重要である。