日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLA/操作arXiv:2608.23138

Pointing-VLA: 視覚言語行動操作のための型付き空間接地インターフェース

Pointing-VLA: Typed Spatial Grounding Interfaces for Vision-Language-Action Manipulation

シェア:XThreadsFacebookLINEはてブBluesky

VLAモデルの空間接地をテキスト座標ではなく型付きヘッドで直接予測し、実行契約によりPICKとPLACEを分離。Bridge/WidowXでSOTAを達成し、実ロボット成功率を52.7%から80.7%に向上させた。

詳しい要約

1. どんなもの?

Pointing-VLAは、Vision-Language-Action (VLA)モデルにおける空間的接地(spatial grounding)を改善するための、型付き隠れ状態空間読み出し(typed hidden-state spatial readout)を提案する研究。Embodied-R1を基盤とし、幾何学特化ヘッド(geometry-specific heads)を用いて、正規化された点(normalized points)、物体機能的接地(OFG)ヒートマップ、視覚的軌跡(visual trajectories)をテキスト化せずに予測する。実行契約(execution contract)により、PICKはOFG、PLACEはPointingに割り当てられ、段階整合的な空間ターゲットを提供する。

2. 先行研究と比べてどこがすごい?

従来のVLAモデルは、空間的接地を自己回帰的なテキスト座標や不透明なアクショントークンで表現し、マルチモーダル推論とロボット実行の間のインターフェースが脆弱だった。Pointing-VLAは、幾何学をテキストとして直列化せず、型付きヘッドで直接予測することで、より効率的で解釈可能なインターフェースを実現。また、Bridge/WidowXでSOTAを達成し、テキスト復号より6.68--6.90倍高速、OFG/接触読み出しはNORA-1.5でコントローラ時間を20倍以上削減するなど、性能と効率の両面で優位性を示す。

3. 技術・手法の肝は?

手法の核心は、Embodied-R1の隠れ状態から幾何学を直接予測する型付きヘッドの導入。具体的には、正規化された点、OFGヒートマップ、視覚的軌跡を予測するヘッドを追加し、テキスト生成を回避。実行契約により、PICKはソース条件付きOFG、PLACEはPointingに割り当て、段階整合的な空間ターゲットを提供。これにより、推論と実行の間のインターフェースを明確化し、効率的で検査可能な空間読み出しを実現。

4. どうやって有効だと検証した?

Bridge/WidowXの4タスクセットで評価し、平均72.9%の成功率でSOTAを達成(Bridge固有のファインチューニングなし、衝突有効なCuRobo実行下)。ネイティブおよびクロスデータセット評価でPointingとOFGの相補的強みを確認。OFG/接触読み出しはNOREA-1.5に転移し、成功率を維持・向上させつつ記録されたコントローラ時間を20倍以上削減。型付きヘッドは共有外部スイートでEmbodied-R1のテキスト復号より6.68--6.90倍高速。π0.5アクションポリシーの空間ガイダンスとして統合した場合、自律実機ロボットの成功率を3つの視覚コンテキストで52.7%から80.7%に向上。

5. 議論はある?

要旨からは、型付き空間読み出しが効率的で検査可能なインターフェースとして確立されたと結論づけられるが、議論の余地としては、特定のタスクセットやロボットプラットフォーム(Bridge/WidowX)に限定した評価であり、汎用性やスケーラビリティに関する追加検証が必要かもしれない。また、OFGとPointingの相補性は示されたが、その使い分けの一般原則や、他のVLAモデルへの適用可能性については要旨からは不明。

6. 次に読むべき論文は?

要旨で参照されている研究として、Embodied-R1、π0.5、NOREA-1.5、Bridge/WidowXデータセット、CuRobo実行環境が挙げられる。次に読むべき論文としては、これらの基盤となったVLAモデル(例:Embodied-R1の元論文)や、空間接地に関する関連手法(例:Grounding DINOやSAM)を調査することが推奨される。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Xiwen Chen, Zelin Li, Zhiruo Zhou, Huiming Chen, Chenwei Wang, Xiaojun Zhu

分類: cs.RO, cs.AI, cs.CV

原文アブストラクト

Vision-language-action (VLA) models often expose spatial grounding through autoregressive text coordinates or opaque action tokens, creating brittle interfaces between multimodal reasoning and robot execution. We present Pointing-VLA, a typed hidden-state spatial readout built on Embodied-R1. Geometry-specific heads predict normalized points, object-functional grounding (OFG) heatmaps, and visual trajectories without serializing geometry as text. For the evaluated Bridge/WidowX and physical pick-place deployments, an explicit execution contract assigns PICK to source-conditioned OFG and PLACE to Pointing, providing direct stage-aligned spatial targets. Pointing-VLA achieves SOTA performance on Bridge/WidowX, averaging 72.9\% across the evaluated four-task set without Bridge-specific finetuning under collision-enabled CuRobo execution. Pointing and OFG show complementary strengths across native and cross-dataset evaluations. The OFG/contact readout transfers to NORA-1.5, preserving or improving success while reducing recorded controller time by more than 20$\times$; typed heads are also 6.68--6.90$\times$ faster than Embodied-R1 text decoding on a shared external suite. When integrated as spatial guidance for a $π_{0.5}$ action policy, Pointing-VLA raises autonomous real-robot success from 52.7\% to 80.7\% across three visual contexts. These results establish typed spatial readouts as an efficient, inspectable interface between embodied reasoning and robot execution.

関連論文