何が起きたか
2025年11月24日にarXivで公開された論文「Compressor-VLA: Instruction-Guided Visual Token Compression for Efficient Robotic Manipulation」において、研究チームはVLAモデルの視覚トークンを指示に応じて圧縮するフレームワーク「Compressor-VLA」を提案した。同手法は、LIBEROベンチマークで競争力のある成功率を維持しつつ、FLOPsを59%、視覚トークン数を3倍以上削減した。
詳細
Compressor-VLAは、Semantic Task Compressor (STC)とSpatial Refinement Compressor (SRC)の2つのトークン圧縮モジュールで構成される。STCは全体的なタスク関連コンテキストを蒸留し、SRCは微細な空間詳細を保持する。圧縮は自然言語の指示によって動的に調整され、タスク関連の視覚情報を適応的に凝縮する。実験では、LIBEROベンチマークでベースラインと比較して競争力のある成功率を達成しつつ、FLOPsを59%、視覚トークン数を3倍以上削減した。また、双腕ロボットプラットフォームでの実機展開により、sim-to-real転送性と実用性が検証された。
Key Facts
| Compressor-VLAは、VLAモデルの視覚トークンを指示に応じて圧縮するフレームワークである。 | 出典一覧 |
| 同手法は、LIBEROベンチマークで競争力のある成功率を維持しつつ、FLOPsを59%削減した。 | 出典一覧 |
| 視覚トークン数をベースラインと比較して3倍以上削減した。 | 出典一覧 |
| フレームワークは、Semantic Task Compressor (STC)とSpatial Refinement Compressor (SRC)の2つのモジュールで構成される。 | 出典一覧 |
| 双腕ロボットプラットフォームでの実機展開により、sim-to-real転送性と実用性が検証された。 | 出典一覧 |
本紙の見方
本論文の位置づけは、VLAモデルの実時間展開における計算ボトルネックへの対処である。既存のトークンプルーニング手法はタスク非依存的で、タスクに重要な視覚情報を保持できないという課題があった。Compressor-VLAは、指示に基づいて圧縮を動的に調整することで、この課題を解決しようとする点が新しい。これは、VLAモデルの効率化における既定路線であるトークン削減の延長線上にあるが、指示条件付けを導入した点が差別化要素である。 業界構造への含意としては、ロボット操作におけるVLAモデルの実用化には計算資源の削減が不可欠であり、本手法はその一助となる可能性がある。特に、エッジデバイスや実機ロボットへの展開を考えると、FLOPs削減は重要である。 未確定の論点としては、LIBEROベンチマーク以外のタスクや、より複雑な環境での性能が不明である。また、実機展開の詳細(成功率やタスクの種類)が論文要旨からは読み取れないため、今後の検証が待たれる。
なぜ重要か
VLAモデルの効率化は、ロボットの実時間制御やエッジ展開に直結する。本手法は、指示に基づく動的なトークン圧縮により、計算コストを大幅に削減しながら性能を維持できる可能性を示しており、今後のロボット知能の実用化に影響を与えるとみられる。