何が起きたか

2026年7月7日にarXivで公開された論文「ActionCache: Training-Free Acceleration for Vision-Language-Action Models with Action Caching and Refinement」において、研究チームはVLAモデルの推論を高速化するプラグアンドプレイの外部キャッシュ「ActionCache」を提案した。シミュレーションと実環境の実験で、π0.5とGR00T-N1.6のアクションヘッド推論をそれぞれ最大10.44倍、40.17倍高速化しつつ、高いタスク成功率を維持したと報告している。

詳細

ActionCacheは、過去の中間アクションをコンパクトなマルチモーダルキーとともに保存し、類似した過去のコンテキストをエピソードやタスクをまたいで検索することで、ターゲットアクションの近傍から生成を開始できるようにする。これにより、フローベースVLAモデルの反復的デノイジングプロセスに伴う計算コストを削減する。論文では、代表的なフローベースVLAモデルであるπ0.5とGR00T-N1.6を用いて、アクションヘッドの推論加速を最大10.44倍と40.17倍と報告している。

Key Facts

ActionCacheは、VLAモデルの推論を高速化するプラグアンドプレイの外部キャッシュである。[1]
ActionCacheは、過去の中間アクションを再利用して生成を初期化することで、反復的デノイジングの計算ボトルネックを軽減する。[1]
ActionCacheは、コンパクトなマルチモーダルキーを用いて、類似した過去のコンテキストをエピソードやタスクをまたいで検索する。[1]
シミュレーションと実環境の実験で、π0.5とGR00T-N1.6のアクションヘッド推論をそれぞれ最大10.44倍と40.17倍高速化した。[1]
ActionCacheは、低レイテンシー領域で高いタスク成功率を維持する。[1]

なぜ重要か

VLAモデルの推論高速化は、ロボットのリアルタイム制御を実現する上で重要な進展であり、産業用ロボットからサービスロボットまで幅広い応用が期待される。ActionCacheは学習不要で既存モデルに適用できるため、導入障壁が低く、VLAモデルの実用化を後押しする可能性がある。