何が起きたか

HABILIS Brain 0は2026-09-22、視覚・言語・行動(VLA)方策向けの手法「Geometry-Change VLA(GC-VLA)」を発表した。GC-VLAは、現在観測から多視点の未来・現在の幾何変化トークンを予測する設計で、オフラインのフレーム対から0.5秒の予測ホライゾンを定義して学習する。評価ではLIBEROで95.20%の成功率を示し、Geometry-Conditioned Residual Flow(GCRF)を組み合わせると99.55%になった。

詳細

学習は4段階で記述されている。Stage 1で幾何変化を扱う視覚・言語モデル(GC-VLM)を学習し、Stage 2で連続的なActionExpertを導入してロボット行動と整合させる。この段階では、VLMインターフェースでaction-flow勾配を停止する。Stage 3では、その勾配が学習可能なVLMコンポーネントとActionExpertを同時に更新できるようにし、Stage 4ではGC-VLAを固定したうえでGCRFを適用する。 GCRFは、binary intervention routerと、closed-loop feedbackから学習した単一のbounded residual velocity policyを用いる。推論時には、現在観測と学習済みのGC表現のみを使い、オフラインのターゲットエンコーダーは実行しない。

Key Facts

HABILIS Brain 0はGC-VLA(Geometry-Change VLA)を提案した。[1]
学習ではオフラインのフレーム対から0.5秒の予測ホライゾンを設定した。[1]
Stage 1からStage 4までの4段階構成で、GC-VLM、ActionExpert、GCRFを順に導入する。[1]
GCRFはbinary intervention routerと単一のbounded residual velocity policyを用いる。[1]
GC-VLAはLIBEROで95.20%、GCRF併用で99.55%の成功率を示した。[1]

本紙の見方

今回の論点は、VLA方策を動かす入力を「現在の幾何」から「幾何変化」へ移した点にある。単なる認識精度の改善ではなく、操作によって変わる状態差分を学習対象にしたことで、視覚表現と行動制御の接続を強める設計だと読める。Stage 1でGC-VLMを作り、Stage 2でActionExpertを合わせ、Stage 3で勾配をVLM側にも通し、Stage 4でGCRFを重ねる構成は、表現学習・行動整合・閉ループ補正を分けて積む手順である。 本紙の関連記事は与えられていないため、過去報道との連続性は置けないが、本文からは二つの読みどころがある。第一に、推論時にオフラインのターゲットエンコーダーを使わず、現在観測と学習済みGC表現だけで動く点である。これは学習時に未来観測をターゲット生成にだけ使い、実運用では現在時刻の情報に閉じる設計であり、学習と推論の役割分担が明確だ。第二に、GCRFがbinary intervention routerとbounded residual velocity policyを採る点で、全面的な再計画ではなく残差的な補正に重心を置いている。成功率が95.20%から99.55%へ上がった事実はこの補正層の効果を示唆するが、どのタスクでどの程度効いたかは本文だけでは切り分けられない。 業界構造への含意としては、ロボット向けVLAの競争軸が、静止画の意味理解から、操作前後の状態差分をどう表現し閉ループで修正するかへ移っている可能性がある。特に、multi-viewの未来・現在幾何変化をトークン化する発想は、映像理解と制御の間に中間表現を置くため、データ収集の設計や学習目標の作り方に影響する。いっぽうで、LIBERO以外の環境で同じ成功率が出るか、GCRFの介入ルータがどの失敗パターンを抑えているかは未確定である。今後は、対象タスクの内訳、学習データの規模、残差制御の安定性、実機での遅延や安全性を確認する必要がある。

なぜ重要か

発表元によれば、GC-VLAはLIBEROで95.20%、GCRF併用で99.55%の成功率を示しており、閉ループの残差補正が操作成否に影響する設計であることがうかがえる。推論時にオフラインのターゲットエンコーダーを使わず、現在観測と学習済みGC表現に絞っているため、実運用での計算手順を簡素化したい研究開発に関係する。

日本への影響

日本への直接的な事業影響は本文からは読み取れない。もっとも、現在観測と幾何変化表現に基づくVLAは、ロボットの視覚・制御スタックの設計に関わるため、日本のロボット研究で重視される実機検証や安全な閉ループ制御との接点はある。