何が起きたか
arXivに2025年10月20日付で掲載された論文「From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors」において、FALCON(From Spatial to Action)と呼ばれる新しいVLAモデルのパラダイムが提案された。FALCONは、空間基盤モデルを活用してRGB画像のみから強い幾何学的先行知識を抽出し、3D空間トークンをアクションヘッドに注入する。これにより、専用センサーを必要とせず、モダリティ間の転送性や視覚言語アライメントの課題に対処する。評価では、3つのシミュレーションベンチマークと11の実世界タスクで最先端の性能を達成し、競合ベースラインを一貫して上回ったと報告されている。
詳細
既存のVLAモデルは3D実世界で動作するが、通常2Dエンコーダに基づいており、空間推論のギャップが一般化と適応性を制限している。最近の3D統合技術は、専用センサーを必要としたり、モダリティ間の転送が不十分だったり、幾何学的情報が弱く視覚言語アライメントを損なうなどの問題があった。FALCONは、空間基盤モデルを用いてRGBのみから強い幾何学的先行知識を提供し、利用可能な場合には深度やポーズを任意に融合できるEmbodied Spatial Modelを備える。これにより、再トレーニングやアーキテクチャ変更なしで高忠実度の情報を利用できる。空間トークンは視覚言語バックボーンに連結されるのではなく、Spatial-Enhanced Action Headによって消費され、言語推論を保持する。これらの設計により、空間表現、モダリティ転送性、アライメントの限界に対処する。
Key Facts
| FALCONは、RGBのみから3D空間トークンを生成し、アクションヘッドに注入する新しいパラダイムである。 | [1] |
| FALCONは空間基盤モデルを活用し、RGBのみから強い幾何学的先行知識を提供する。 | [1] |
| FALCONはEmbodied Spatial Modelを備え、利用可能な場合に深度やポーズを任意に融合できる。 | [1] |
| 空間トークンはSpatial-Enhanced Action Headによって消費され、視覚言語バックボーンには連結されない。 | [1] |
| FALCONは3つのシミュレーションベンチマークと11の実世界タスクで評価された。 | [1] |
| FALCONは最先端の性能を達成し、競合ベースラインを一貫して上回ったと報告されている。 | [1] |
| FALCONは、クラッター、空間プロンプト条件付け、物体のスケールや高さの変動に対して堅牢であるとされる。 | [1] |
なぜ重要か
FALCONは、VLAモデルの空間推論ギャップに対処する新しい手法を提案しており、専用センサーなしでRGBのみから3D情報を活用できる点で、ロボットの一般化と適応性の向上に寄与する可能性がある。