何が起きたか

研究チームは2026年8月24日、視覚言語行動(VLA)モデルの空間指示をテキスト座標ではなく専用ヘッドで行う「Pointing-VLA」を発表した。Bridge/WidowXの4タスク評価で平均72.9%の成功率を達成し、実機では成功率を52.7%から80.7%に向上させた。テキスト復号と比べ6.68〜6.90倍高速で、接触読み出しはNORA-1.5で制御時間を20倍以上短縮した。

詳細

Pointing-VLAはEmbodied-R1を基盤とし、幾何学専用ヘッドが正規化点、物体機能接地(OFG)ヒートマップ、視覚的軌跡を予測する。実行契約ではPICKをOFG、PLACEをPointingに割り当てる。Bridge/WidowXで平均72.9%の成功率を達成し、CuRobo実行下でBridge固有の微調整なしにSOTAを達成した。OFG/接触読み出しはNORA-1.5に転送され、成功率を維持・向上させつつ記録された制御時間を20倍以上短縮した。型付きヘッドは共有外部スイートでEmbodied-R1のテキスト復号より6.68〜6.90倍高速。π0.5行動ポリシーの空間ガイダンスとして統合した場合、実機成功率を3つの視覚コンテキストで52.7%から80.7%に引き上げた。

Key Facts

Pointing-VLAはBridge/WidowXの4タスク評価で平均72.9%の成功率を達成した。[1]
実機では成功率を52.7%から80.7%に向上させた。[1]
型付きヘッドはEmbodied-R1のテキスト復号より6.68〜6.90倍高速。[1]
OFG/接触読み出しはNORA-1.5で制御時間を20倍以上短縮した。[1]
実行契約はPICKをOFG、PLACEをPointingに割り当てる。[1]

本紙の見方

Pointing-VLAの核心は、VLAモデルの空間接地をテキスト座標や不透明な行動トークンから解放し、型付きの隠れ状態読み出しに置き換えた点にある。これにより、推論と実行の間のインターフェースが「検査可能」になり、幾何学的情報をテキストに直列化する際の情報損失を回避している。評価結果は、この設計が単なる理論的優位性に留まらず、実機成功率を52.7%から80.7%へと引き上げる具体的な効果を持つことを示す。 本稿は過去の関連記事を持たないため、連続性の分析はできないが、VLAモデルの進化という文脈では、空間接地の方法論が「テキスト座標」から「専用ヘッド」へ移行する流れの一環と位置づけられる。特に、OFGとPointingをタスク段階に応じて使い分ける実行契約は、従来の単一インターフェースでは難しかった段階整合的な空間目標を提供し、PICKとPLACEの各段階で最適な表現を選択する点が新しい。 業界構造への含意として、この成果はロボット操作におけるVLAモデルの実用性を高め、計算コストの削減(テキスト復号比6.68〜6.90倍高速)と制御時間の短縮(20倍以上)をもたらす。これにより、実機展開時のレイテンシー要件が緩和され、より複雑なタスクへの適用可能性が広がる。また、OFG/接触読み出しがNORA-1.5に転送可能であることは、異なるロボット基盤への移植性を示唆し、モデルの再利用性を高める。 未確定の論点としては、評価対象がBridge/WidowXとNORA-1.5に限定されており、他のロボットプラットフォームやより多様なタスクでの性能が不明である点が挙げられる。また、実機成功率の向上はπ0.5行動ポリシーとの統合時のみで報告されており、Pointing-VLA単体での実機性能や、他の行動ポリシーとの組み合わせでの効果は検証されていない。さらに、型付きヘッドの設計がどの程度の追加学習コストを要するか、またOFGヒートマップの品質がタスクの複雑さにどう影響するかも今後の確認事項である。

なぜ重要か

Pointing-VLAは、VLAモデルの空間接地を効率化し、実機成功率を大幅に向上させることで、ロボット操作の実用化を前進させる。計算コストの削減と制御時間の短縮は、リアルタイム性が求められる現場での導入障壁を下げる。