何が起きたか

研究チームは2026年7月29日、arxiv.orgでTurboVLAを発表した。TurboVLAは、視覚と言語の入力を独立にエンコードし、軽量な双方向相互作用で情報を交換して連続的なアクションチャンクを予測する。LIBEROベンチマークで平均成功率97.7%、推論レイテンシ31.2ms、推論時VRAM使用量0.9GBを達成し、RTX 4090上で32Hzのリアルタイム動作を実現した。

詳細

TurboVLAは、従来のVLAモデルが採用するLLM中心のV→L→A経路を、直接的なV+L→Aマッピングに再構成する。視覚観測と言語指示を独立にエンコードし、軽量な双方向ビジョン・ランゲージ相互作用で情報を交換し、コンパクトなデコーダで連続アクションチャンクを予測する。パラメータ数は0.2Bで、LIBEROベンチマークで平均成功率97.7%、推論レイテンシ31.2ms、推論時VRAM使用量0.9GBを達成。コンシューマ向けRTX 4090上で32Hzのリアルタイム動作を実現した。コードはhttps://github.com/H-EmbodVis/TurboVLAで公開されている。

Key Facts

TurboVLAは、従来のLLM中心のV→L→A経路を直接的なV+L→Aマッピングに再構成した新しいVLAパラダイムを提案した。[1]
TurboVLAは、LIBEROベンチマークで平均成功率97.7%を達成した。[1]
TurboVLAは、パラメータ数0.2B、推論レイテンシ31.2ms、推論時VRAM使用量0.9GBを達成した。[1]
TurboVLAは、コンシューマ向けRTX 4090上で32Hzのリアルタイム動作を実現した。[1]
TurboVLAのコードはhttps://github.com/H-EmbodVis/TurboVLAで公開されている。[1]

本紙の見方

TurboVLAの提案は、VLAモデルの設計思想における転換点を示す。従来のVLAモデルは、視覚観測をLLMの表現空間に投影してからアクションをデコードするLLM中心の経路が主流であり、推論のたびに大きな計算コストとメモリコストが発生していた。TurboVLAはこの経路を直接的なV+L→Aマッピングに再構成し、LLMを中央インターフェースとして使わずに、視覚と言語の特徴を軽量な双方向相互作用で直接交換し、コンパクトなデコーダでアクションを予測する。この設計により、0.2Bパラメータという極めて小規模なモデルで、LIBERO平均成功率97.7%を達成し、より大規模なVLAポリシーに匹敵または上回る性能を示した。 この成果は、VLAモデルの実用化における計算資源の障壁を大幅に引き下げる可能性がある。従来のVLAモデルは、大規模なLLMを搭載するため、推論に高性能なGPUと大容量メモリが必要であり、エッジデバイスやコンシューマ向けハードウェアでのリアルタイム動作は困難だった。TurboVLAは、RTX 4090というコンシューマ向けGPUで32Hzのリアルタイム動作を実現し、VRAM使用量も0.9GBに抑えた。これにより、ロボット操作の推論をより身近なハードウェアで実行できる可能性が示された。 一方で、この成果はLIBEROベンチマークに基づくものであり、実世界の多様な環境での汎用性は未検証である。また、0.2Bパラメータという小規模モデルが、複雑なタスクや長いシーケンスでどの程度の性能を発揮するかは不明だ。さらに、双方向の視覚・言語相互作用の設計が、どのようなタスク特性で有効に機能するのかという理論的な理解も今後の課題となる。 業界構造への含意として、VLAモデルの軽量化は、ロボットメーカーがクラウド依存からエッジ推論へ移行する動きを加速させる可能性がある。特に、コスト制約の厳しい中小企業や研究機関にとって、高性能なVLAモデルを低コストで導入できる道が開かれる。また、このような軽量モデルの登場は、GPUベンダーやクラウドサービスプロバイダーにとっては、推論需要の変化をもたらす可能性がある。 未確定の論点としては、実世界のロボット操作タスクでの成功率、複雑なタスクや長いシーケンスでの性能、双方向相互作用の設計の理論的根拠、そして他のベンチマークでの汎用性が挙げられる。

なぜ重要か

TurboVLAは、VLAモデルの計算コストとメモリコストを大幅に削減し、コンシューマ向けGPUでのリアルタイム動作を実現した。これにより、ロボット操作AIの実用化が加速し、エッジデバイスでの展開やコスト削減が期待される。