何が起きたか
研究者らは、ロボットの推論と行動を単一のオートリグレッシブストリームで処理する新しいVLAモデル「G0.5」を発表した。従来のVLAモデルが事前学習済みVLMと別途訓練されたフローマッチング行動エキスパートを組み合わせるのに対し、G0.5は単一のトランスフォーマーデコーダーが推論と行動のトークンを単一の目的で生成する。
詳細
G0.5は、事前学習済みのオートリグレッシブVLAであり、単一のトランスフォーマーデコーダーが推論と行動のトークンを単一の目的で生成する。従来のVLAモデルは、事前学習済みVLMと別途訓練されたフローマッチング行動エキスパートを組み合わせる方式が一般的で、VLMは文脈エンコーダーとして機能し、意思決定者ではなかった。G0.5では、3つのコンポーネントにより基盤モデル規模での学習を可能にしている。1つ目は、異なるロボットの行動を共通の語彙にマッピングする学習可能なクロスエンボディメント行動トークナイザー、2つ目は、タスク分解、オブジェクトグラウンディング、行動ヒントを行動トークンと交互に配置するネイティブなチェーン・オブ・ソートストリーム、3つ目は、視覚エンコーダーを通じて複数秒の履歴を注入する視覚メモリモジュールである。 推論と行動が単一の重みセットを共有するため、事前学習済みVLMの能力が物理的な行動に引き継がれ、モデルは指示に厳密に従い、プロンプトが行動の粒度、タスクの水平線、分布外のシーン処理を直接制御する。追加の訓練は不要である。G0.5は、大規模なロボットデータセットとVQAサンプルで事前学習され、7つの独立した評価で最先端モデルを上回ったと報告されている。
Key Facts
| G0.5は、単一のトランスフォーマーデコーダーが推論と行動のトークンを単一の目的で生成する事前学習済みオートリグレッシブVLAモデルである。 | [0] |
| G0.5は、学習可能なクロスエンボディメント行動トークナイザー、ネイティブなチェーン・オブ・ソートストリーム、視覚メモリモジュールの3つのコンポーネントで構成される。 | [0] |
| G0.5は、大規模なロボットデータセットとVQAサンプルで事前学習された。 | [0] |
| G0.5は、R1liteおよびR1proロボットでの実世界ファインチューニングで76.7%の成功率を達成し、π0.5の53.3%、GR00T-N1.7の24.4%を上回った。 | [0] |
| G0.5は、2025年BEHAVIORチャレンジの50の長期的な家庭用モバイル操作タスクで31.4%の成功率を達成し、π0.5の26.3%、チャレンジ勝者の26.1%を上回った。 | [0] |
| G0.5は、DROIDポストトレーニング後の未見環境とオブジェクトへのゼロショット転送で82.5%の成功率を達成した。 | [0] |
| G0.5は、言語指示に従うPick-and-Placeベンチマークで98.9%の成功率を達成した。 | [0] |
| G0.5は、LIBEROで98.9%、RoboTwin 2.0で93.3%、SimplerEnv-Bridgeで87.3%の成功率を達成した。 | [0] |
なぜ重要か
G0.5は、VLAモデルの設計において、VLMを単なる文脈エンコーダーではなく意思決定者として扱う新しいアプローチを示している。単一のオートリグレッシブストリームで推論と行動を統合することで、事前学習済みVLMの能力を物理的な行動に直接活用でき、追加訓練なしで行動の粒度やタスクの水平線を制御できる可能性がある。