何が起きたか

2026年8月25日にarXivで公開された論文で、GaussVLAという新しいVision-Language-Action (VLA)モデルが提案された。GaussVLAは、Mambaベースのアーキテクチャに、Gaussian Spatial Tokenizer (GST)とDepth-Aware Chain-of-Thought (DA-CoT)という2つのモジュールを組み込む。LIBEROベンチマークで平均成功率93.5%、Spatialスイートで100.0%を達成し、SpatialVLAと比較して相対平均成功率を19.7%向上させた。パラメータ数は200Mで、パラメータ効率が高い。

詳細

GaussVLAは、視覚観察をフラットな2Dパッチトークンとしてエンコードする従来のVLAモデルの限界を克服する。GSTは、凍結されたセマンティック特徴と深度特徴をコンパクトな3Dガウシアントークンに変換し、学習されたクエリで幾何学的に顕著な領域をプールする。DA-CoTは、言語とフロー時間の条件付けの下で、構造化された非自己回帰的な幾何学的推論を実行する。評価はシミュレーションと実世界の両方で行われ、LIBEROでは平均成功率93.5%、Spatialスイートで100.0%を達成した。パラメータ数は200Mで、SpatialVLAよりも大幅にパラメータ効率が高い。

Key Facts

GaussVLAはMambaベースのVLAモデルで、Gaussian Spatial Tokenizer (GST)とDepth-Aware Chain-of-Thought (DA-CoT)を導入する。[1]
LIBEROベンチマークで平均成功率93.5%、Spatialスイートで100.0%を達成した。[1]
SpatialVLAと比較して相対平均成功率を19.7%向上させた。[1]
パラメータ数は200Mで、パラメータ効率が高い。[1]
GSTは凍結されたセマンティック特徴と深度特徴を3Dガウシアントークンに変換し、DA-CoTは非自己回帰的な幾何学的推論を行う。[1]

本紙の見方

GaussVLAの提案は、VLAモデルにおける空間推論の課題に取り組むものである。従来のVLAモデルは視覚観察を2Dパッチトークンとして扱うため、幾何学的構造が欠落していた。GaussVLAは、3Dガウシアントークン化により、深度情報を単なるスカラー値ではなく、表面の向きや幾何学的信頼度を含む形で表現する。これにより、ポリシーはより構造化された空間推論が可能になる。 本論文の成果は、パラメータ効率の高さが際立つ。200MパラメータでSpatialVLAを上回る性能を達成しており、これは実ロボットへの展開を考える際に重要な利点となる。また、DA-CoTによる非自己回帰的な推論は、計算コストを抑えつつ、言語条件とフロー時間条件を考慮した幾何学的推論を実現する。 業界への含意として、VLAモデルの空間推論能力の向上は、ロボットの操作タスクにおける精度向上に直結する。特に、LIBEROのSpatialスイートで100%の成功率は、空間的な配置や方向を理解する能力が高いことを示している。これは、倉庫でのピッキングや組立作業など、空間認識が重要な応用分野での実用化を後押しする可能性がある。 一方で、未確定の論点として、実世界での評価の詳細(タスクの種類や環境)が論文の要旨からは不明であり、シミュレーションと実世界のギャップがどの程度あるのかは今後の検証が必要である。また、3Dガウシアントークン化の計算コストや、他のベンチマークでの性能も確認する必要がある。

なぜ重要か

GaussVLAは、VLAモデルの空間推論を強化する新しい手法であり、パラメータ効率の高さと高い成功率を両立させた点で、ロボット操作の実用化に向けた重要な一歩となる。特に、3Dガウシアン表現と非自己回帰的推論の組み合わせは、今後のVLAモデルの設計に影響を与える可能性がある。