日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2608.24959

GaussVLA:幾何認識型空間推論を備えた視覚言語行動モデル

GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model

シェア:XThreadsFacebookLINEはてブBluesky

視覚言語行動モデルに3Dガウス表現と深度認識型思考連鎖を導入し、空間操作性能を向上させた。

詳しい要約

1. どんなもの?

GaussVLAは、Vision-Language-Action (VLA)モデルの空間推論能力を向上させるための新しいモデルである。従来のVLAモデルは視覚観測を2Dパッチトークンとしてエンコードし、幾何学的構造を持たないため、空間的な推論が限られていた。GaussVLAは、Mambaベースのアーキテクチャに、Gaussian Spatial Tokenizer (GST)とDepth-Aware Chain-of-Thought (DA-CoT)という2つのモジュールを導入する。GSTは凍結されたセマンティック特徴と深度特徴をコンパクトな3D Gaussianトークンに変換し、学習されたクエリで幾何学的に重要な領域をプールする。DA-CoTは、言語とフロー時間の条件付けの下で、構造化された非自己回帰的な幾何学的推論を行う。これにより、パラメータ効率を保ちながら、シミュレーションと実世界の両方で強い空間操作性能を達成する。

2. 先行研究と比べてどこがすごい?

先行研究のVLAモデルは、2Dパッチトークンや単眼深度のピクセル値を使用しており、表面の向きや幾何学的信頼度をエンコードできず、空間推論が限定的だった。GaussVLAは、3D Gaussianトークンを用いることで、幾何学的構造を明示的に表現し、深度情報をよりリッチに活用する。また、DA-CoTにより、言語とフロー時間の条件付けの下で構造化された推論を行う点が新しい。さらに、パラメータ効率が高く、SpatialVLAと比較して平均成功率で19.7%の相対改善を達成しつつ、パラメータ数が大幅に少ない。

3. 技術・手法の肝は?

GaussVLAはMambaベースのVLAモデルで、2つの主要モジュールを持つ。GSTは、凍結されたセマンティック特徴と深度特徴を入力とし、それらを3D Gaussianトークンに変換する。具体的には、特徴を3D空間にリフトし、ガウス分布として表現することで、コンパクトで幾何学的に意味のあるトークンを生成する。学習されたクエリを用いて、幾何学的に重要な領域をプールする。DA-CoTは、言語とフロー時間の条件付けの下で、非自己回帰的なチェーン・オブ・ソートを行う。これにより、アクション予測の前に構造化された幾何学的推論を実行する。

4. どうやって有効だと検証した?

シミュレーションと実世界の両方で評価された。シミュレーションではLIBEROベンチマークを使用し、平均成功率93.5%、Spatialスイートで100.0%の成功率を達成した。パラメータ数は200Mで、SpatialVLAと比較して平均成功率で19.7%の相対改善を示した。実世界での評価も行われたが、詳細は要旨からは不明。

5. 議論はある?

要旨からは、GaussVLAの限界や議論についての詳細は不明。ただし、パラメータ効率と性能のトレードオフ、3D Gaussianトークンの表現力、DA-CoTの推論プロセスなどについてさらなる分析が必要かもしれない。また、実世界での汎化性能や、他のタスクへの適用可能性については言及されていない。

6. 次に読むべき論文は?

要旨で参照されているSpatialVLAが比較対象として挙げられている。また、VLAモデルの一般的な研究として、Vision-Language-Actionモデルの基盤となる研究(例えば、RT-2やPaLM-Eなど)が関連する。さらに、3D Gaussian表現を用いた研究や、Mambaベースのモデルも関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Md Selim Sarowar, Md Tanvir Islam, Sungho Kim, Sangtae Ahn

分類: cs.RO, cs.CV

原文アブストラクト

Vision-Language-Action (VLA) models encode visual observations as flat 2D patch tokens that carry no intrinsic geometric structure, and augmenting them with dense monocular depth injects per-pixel scalar values that encode neither surface orientation nor geometric confidence. This leaves the policy with limited structured spatial reasoning for action prediction. We propose GaussVLA, a Mamba-based VLA that incorporates two custom modules: Gaussian Spatial Tokenizer (GST) to lift frozen semantic and depth features into compact 3D Gaussian tokens, pools geometrically salient regions with learned queries, and \emph{Depth-Aware Chain-of-Thought (DA-CoT)} that performs structured, non-autoregressive geometric reasoning under language and flow-time conditioning. Across both simulation and real-world evaluations, GaussVLA demonstrates strong spatial-manipulation performance while remaining parameter-efficient. On LIBERO, it achieves 93.5% average success and 100.0% success on the Spatial suite with only 200M parameters, improving over SpatialVLA by 19.7% relative average success while remaining significantly more parameter-efficient.

関連論文