日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2609.25558

HABILIS Brain 0: 視覚言語行動と残差フロー回復のための幾何変化監督

HABILIS Brain 0: Geometry-Change Supervision for Vision-Language-Action and Residual Flow Recovery

シェア:XThreadsFacebookLINEはてブBluesky

現在の観測からマルチビューの未来-現在の幾何変化トークンを予測するGC-VLAを提案し、4段階の学習でLIBEROにおいて99.55%の成功率を達成した。

詳しい要約

1. どんなもの?

- 本論文は、Vision-Language-Action (VLA) ポリシーのための新しい学習フレームワーク「Geometry-Change VLA (GC-VLA)」を提案する。 - 現在の観測からマルチビューの未来-現在の幾何変化トークンを予測することを学習する。 - オフラインのフレームペアが0.5秒の予測ホライズンを定義し、未来の観測は訓練ターゲットの構築にのみ使用される。 - 4段階の訓練プロセスを経て、LIBEROで95.20%、GCRF併用で99.55%の成功率を達成。 - 推論時は現在の観測と学習されたGC表現のみを使用し、オフラインのターゲットエンコーダは実行しない。

2. 先行研究と比べてどこがすごい?

- 従来のVLAポリシーは現在フレームの幾何情報のみを監督に用いるが、操作に伴う変化を明示的に記述できない。 - 本手法は未来-現在の幾何変化を予測することで、操作に関連する変化を明示的に学習する。 - また、ロボット固有の行動アラインメント前に、ロボットとエゴセントリックビデオを横断して事前学習可能な、身体性に依存しない視覚インターフェースの学習を目指す。 - これにより、従来手法よりも高い成功率を実現している。

3. 技術・手法の肝は?

- 4段階の訓練を採用。 - Stage 1: 幾何変化視覚言語モデル (GC-VLM) を訓練。 - Stage 2: 連続ActionExpertを導入し、VLMインターフェースで行動フローの勾配を停止しつつロボット行動とアラインメント。 - Stage 3: これらの勾配を有効化し、訓練可能なVLMコンポーネントをActionExpertと共同で更新。 - Stage 4: GC-VLAを凍結し、Geometry-Conditioned Residual Flow (GCRF) を適用。バイナリ介入ルーターと、閉ループフィードバックから学習される単一の有界残差速度ポリシーを使用。 - 推論時は現在の観測と学習されたGC表現のみを使用。

4. どうやって有効だと検証した?

- LIBEROベンチマークで評価を実施。 - GC-VLAは95.20%の成功率を達成。 - GC-VLA with GCRFは99.55%の成功率を達成。 - これにより、提案手法の有効性が検証された。

5. 議論はある?

- 要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究は明示されていない。 - 関連手法として、Vision-Language-Action (VLA) ポリシー、Geometry-Change VLA (GC-VLA)、Geometry-Conditioned Residual Flow (GCRF) が挙げられる。 - 同分野の定番として、LIBEROベンチマークやVision-Language Models (VLM) が考えられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Jinu Pahk, Jesoon Kang, Taegeon Park, Jisu An, Soo Min Kimm, Jaejoon Kim, Byoung-Tak Zhang

分類: cs.RO, cs.LG

原文アブストラクト

Vision-language-action policies benefit from geometric supervision, but current-frame geometry alone does not explicitly describe the changes associated with manipulation. This design is motivated by the goal of learning an embodiment-agnostic visual interface that can be pretrained across robot and egocentric video before robot-specific action alignment. We introduce Geometry-Change VLA (GC-VLA), which learns to predict multiview future-current geometry-change tokens from current observations. Offline frame pairs define a nominal 0.5-second prediction horizon; future observations are used only to construct training targets. Stage 1 trains a geometry-change vision-language model (GC-VLM). Stage 2 introduces a continuous ActionExpert and aligns it with robot actions while stopping action-flow gradients at the VLM interface. Stage 3 enables these gradients to update the trainable VLM components jointly with the ActionExpert. Stage 4 freezes GC-VLA and applies Geometry-Conditioned Residual Flow (GCRF), using a binary intervention router and a single bounded residual velocity policy learned from closed-loop feedback. GC-VLA achieves 95.20% success on LIBERO, and GC-VLA with GCRF achieves 99.55%. Inference uses current observations and the learned GC representation without executing the offline target encoders.

関連論文

PR本紙発行元 EmplifAI