何が起きたか

arxiv.orgに2026-10-04付で掲載された論文は、視覚言語行動モデル向け手法「GeoBridge-VLA」を発表した。既存の凍結済み視覚エンコーダから幾何特徴を学ぶ2段階方式で、RGB、ロボット状態、言語を入力に使い、深度観測は不要としている。論文は、ROBOTIS OMY実機で4課題200試行中148回成功し、成功率74.0%だったと報告した。

詳細

GeoBridge-VLAは、第1段階でfeature bridgeとgeometry decoderを深度監督つきで学習し、第2段階でこれらを固定したうえで、gated residual interface、action-side projections、action expertを学習する構成である。既存の視覚トークンを残差で補強する設計のため、2つ目の画像エンコーダを追加せず、トークン数も増やさないとしている。 論文は、同条件の評価でLIBERO上の成功率が70.9%で、SmolVLAの60.0%を上回ったと示した。また、同じ学習済みチェックポイントで残差を無効化すると成功率は70.90%から69.85%に低下したとしている。物理ロボット実験では、ROBOTIS OMYで148/200回成功、対するSmolVLAは108/200回成功だった。

Key Facts

GeoBridge-VLAは、凍結済み視覚エンコーダから幾何特徴を学ぶ2段階方式である。[1]
第1段階はfeature bridgeとgeometry decoderを深度監督つきで学習し、第2段階はgated residual interfaceとaction-side projections、action expertを学習する。[1]
推論時の入力はRGB、robot state、languageであり、深度観測は不要である。[1]
同条件の評価でLIBERO上の成功率は70.9%で、SmolVLAの60.0%を上回った。[1]
ROBOTIS OMY実機では4課題200試行中148回成功し、成功率は74.0%だった。[1]

本紙の見方

今回の論文の新しさは、視覚言語行動モデルに幾何情報を後付けする方法を、深度監督つきのfeature bridgeとgeometry decoder、さらに残差インターフェースの二層で具体化した点にある。一方で、RGB・ロボット状態・言語を使い、深度観測を要しないという運用条件は、VLA系の既定路線である「既存の視覚表現を活かしつつ操作性能を上げる」延長線上にある。2つ目の画像エンコーダを追加せず、トークン数も増やさない設計は、計算量や入力設計の肥大化を避ける意図が読み取れる。 本紙の過去報道との接続では、Robotis、研究向けヒューマノイド「AI Sapiens K1」を紹介で示された「実機上での運動、学習、制御の開発に向けたヒューマノイド・プラットフォーム」という文脈とつながる。今回はRobotisの研究用機体が、単なる展示物ではなく、VLA手法の実機評価先として使われている点が確認できる。ただし、論文はRobotisそのものの製品評価ではなく、手法の評価結果であるため、機体性能とアルゴリズム性能は切り分けて読む必要がある。 業界構造への含意としては、幾何推論を深度センサの常時利用ではなく残差適応で取り込む設計が、既存のRGB中心のロボット構成に載せやすい可能性がある。ROBOTIS OMYでの74.0%という物理実験結果は、シミュレーションやベンチマークだけでなく、実機での移植性が論点であることを示す。ただし、LIBEROの70.9%と実機74.0%は条件が異なるため、一般化には慎重さが必要である。今後確認すべきは、対象タスクの種類、実機での失敗要因、残差を切った69.85%との差が実運用上どの程度意味を持つか、そしてROBOTIS OMY以外の機体で同じ構成が再現するかである。

なぜ重要か

発表元の論文によれば、GeoBridge-VLAは深度観測なしでRGB・robot state・languageから動作を予測し、ROBOTIS OMY実機で74.0%の成功率を示した。深度センサを前提にしない構成は、既存のロボット入力設計を変えずに幾何情報を補えるかどうかを判断する材料になる。 また、同条件でSmolVLAの60.0%を上回ったとされるため、評価系が同じであれば、残差適応の有無が性能差の焦点になりやすい。

日本への影響

ROBOTIS OMYが実機評価に使われた点から、日本のロボット研究でも、RGB中心の既存構成に幾何推論を重ねる手法の比較対象として参照される可能性がある。もっとも、論文が示したのは特定タスクと特定機体での結果であり、日本企業や日本の機体にそのまま移せるかは別問題である。