何が起きたか
研究チームは2026年8月26日、VLAモデルの行動エキスパートがVLM特徴に含まれる3D幾何・2D意味情報へのアクセスが限定的である問題を指摘し、視覚表現を明示的に回復するV-Linkを提案した。V-LinkはVLM内でSpatial QueryとSemantic Queryを学習し、Action DiTに非対称経路で注入する。評価では、LIBEROで+1.9%、LIBERO-Plusで+31.2%、RoboTwin 2.0で+18.8%の成功率向上を達成。実機のAGIBOT A3 Ultraでは2つのタスクで+20%と+24%の改善を示した。
詳細
V-Linkは、VLMから行動生成部(Action DiT)への特徴転送時に視覚表現を回復する手法。Semantic Queryは元のVLM画像トークンを補完し、Spatial Queryは空間的に接地された行動生成のための幾何条件付けを提供する。ベースモデルはGR00T N1.6。評価環境はLIBERO、LIBERO-Plus、RoboTwin 2.0の3つのシミュレーションと、実機ヒューマノイドAGIBOT A3 Ultra。実機では2つのタスクで成功率が+20%と+24%向上した。
Key Facts
| V-LinkはVLAモデルの行動エキスパートがVLM特徴の3D幾何・2D意味情報にアクセスしにくい問題を解決する手法として提案された。 | [1] |
| V-LinkはSpatial QueryとSemantic QueryをVLM内で学習し、Action DiTに非対称経路で注入する。 | [1] |
| LIBEROで+1.9%、LIBERO-Plusで+31.2%、RoboTwin 2.0で+18.8%の成功率向上を達成した。 | [1] |
| 実機ヒューマノイドAGIBOT A3 Ultraで2タスクの成功率が+20%と+24%向上した。 | [1] |
| ベースモデルはGR00T N1.6。 | [1] |
本紙の見方
V-Linkの提案は、VLAモデルのアーキテクチャ上の欠陥に着目した点で新規性が高い。従来のVLAモデルは視覚と言語を統合するVLMと連続行動を生成するAction DiTを接続するが、行動エキスパートがVLM特徴の豊かな情報を十分に活用できていないという問題が指摘されていた。V-Linkはこのアクセスギャップを埋めるために、VLM内で学習したSpatial QueryとSemantic Queryを非対称経路でAction DiTに注入する。これにより、幾何情報と意味情報を補完し、細かい操作タスクの性能を向上させる。 本手法の特徴は、既存のVLAモデルに追加のモジュールを組み込むだけで実装できる点にある。ベースモデルGR00T N1.6に対する改善幅は、シミュレーション環境によって大きく異なる。LIBEROでは+1.9%と小幅だが、LIBERO-Plusでは+31.2%、RoboTwin 2.0では+18.8%と大幅な改善を示した。この差は、各環境のタスクの複雑さや視覚情報の重要性の違いを反映しているとみられる。特にLIBERO-Plusはより多様なタスクを含むため、視覚表現の回復が効果的に働いた可能性がある。 実機ヒューマノイドAGIBOT A3 Ultraでの+20%と+24%の改善は、シミュレーションから実機への転移可能性を示す重要な結果である。ヒューマノイドは自由度が高く、正確な空間認識が要求されるため、Spatial Queryによる幾何条件付けが特に有効に機能したと考えられる。ただし、実機タスクの詳細(タスク内容、試行回数、成功率の定義)は論文本文で確認する必要がある。 業界構造への含意として、VLAモデルの性能向上がロボットの汎用操作能力を押し上げる可能性がある。特に、ヒューマノイドロボットの実用化には、複雑な環境での正確な操作が不可欠であり、V-Linkのような手法はその基盤技術となり得る。また、V-Linkはモデルアーキテクチャの改良であり、特定のハードウェアに依存しないため、様々なロボットプラットフォームに適用できる可能性がある。 未確定の論点としては、V-Linkの計算コストや推論速度への影響、他のVLAモデルへの適用可能性、より複雑な実環境での性能が挙げられる。また、Spatial QueryとSemantic Queryの設計がどの程度タスクに依存するかも今後の検証が必要である。
なぜ重要か
V-Linkは、VLAモデルの性能を引き出すための重要な改良であり、ロボット操作の精度向上に直結する。特に実機ヒューマノイドでの大幅な改善は、汎用ロボットの実用化に向けた一歩となる。