何が起きたか

2025年11月24日にarXivで公開された論文「Compressor-VLA: Instruction-Guided Visual Token Compression for Efficient Robotic Manipulation」において、研究チームはVLAモデルの視覚トークンを指示に応じて圧縮するフレームワーク「Compressor-VLA」を提案した。同手法は、LIBEROベンチマークで競争力のある成功率を維持しつつ、FLOPsを59%、視覚トークン数を3倍以上削減した。

詳細

Compressor-VLAは、Semantic Task Compressor (STC)とSpatial Refinement Compressor (SRC)の2つのトークン圧縮モジュールで構成される。STCは全体的なタスク関連コンテキストを蒸留し、SRCは微細な空間詳細を保持する。圧縮は自然言語の指示によって動的に調整され、タスク関連の視覚情報を適応的に凝縮する。実験では、LIBEROベンチマークでベースラインと比較して競争力のある成功率を達成しつつ、FLOPsを59%、視覚トークン数を3倍以上削減した。また、双腕ロボットプラットフォームでの実機展開により、sim-to-real転送性と実用性が検証された。

Key Facts

Compressor-VLAは、VLAモデルの視覚トークンを指示に応じて圧縮するフレームワークである。[1]
同手法は、LIBEROベンチマークで競争力のある成功率を維持しつつ、FLOPsを59%削減した。[1]
視覚トークン数をベースラインと比較して3倍以上削減した。[1]
フレームワークは、Semantic Task Compressor (STC)とSpatial Refinement Compressor (SRC)の2つのモジュールで構成される。[1]
双腕ロボットプラットフォームでの実機展開により、sim-to-real転送性と実用性が検証された。[1]

なぜ重要か

VLAモデルの効率化は、ロボットの実時間制御やエッジ展開に直結する。本手法は、指示に基づく動的なトークン圧縮により、計算コストを大幅に削減しながら性能を維持できる可能性を示しており、今後のロボット知能の実用化に影響を与えるとみられる。