何が起きたか
2026年6月15日にarXivで公開された論文「Geometric Action Model for Robot Policy Learning」において、研究チームは言語条件付き操作ポリシーGAMを発表した。GAMは事前学習済みの幾何基盤モデルを中間層で分割し、浅い層を観測エンコーダ、分割層に挿入した因果的未来予測器が言語・プロプリオセプション・行動履歴に基づき未来の潜在トークンを予測する。予測されたトークンは残りのGFMブロックを通じて特徴伝播とデコードに使われ、単一バックボーンで未来の幾何と行動を生成する。
詳細
GAMは、言語条件付き操作ポリシーであり、事前学習済みの幾何基盤モデルを直接再利用する。GFMを中間層で分割し、浅い層を観測エンコーダとして使用し、分割層に因果的未来予測器を挿入する。この予測器は、言語、プロプリオセプション、行動履歴に条件付けられて未来の潜在トークンを予測する。予測された未来トークンは、残りのGFMブロックを通じて特徴伝播とデコードに供され、単一のバックボーンが未来の幾何と行動の両方を生成する。この設計により、最小限のアーキテクチャ変更でGFMに言語条件付きの時間的世界モデリングを装備し、幾何学的な事前知識を保持する。
Key Facts
| GAMは、事前学習済みの幾何基盤モデルを直接再利用する言語条件付き操作ポリシーである。 | 出典一覧 |
| GAMはGFMを中間層で分割し、浅い層を観測エンコーダとして使用する。 | 出典一覧 |
| 分割層に挿入された因果的未来予測器が、言語・プロプリオセプション・行動履歴に基づき未来の潜在トークンを予測する。 | 出典一覧 |
| 予測された未来トークンは残りのGFMブロックを通じて特徴伝播とデコードに使われ、単一バックボーンで未来の幾何と行動を生成する。 | 出典一覧 |
| シミュレーションと実ロボットの操作ベンチマークで、GAMは既存の基盤モデル規模のベースラインより高精度・高ロバスト・高速・軽量であるとされる。 | 出典一覧 |
本紙の見方
今回のGAMの提案は、ロボット政策学習における基盤モデルの活用方法に一石を投じるものだ。従来のVLAやWAMは2D画像フレームや2D由来の潜在空間で動作し、接触を伴う操作に必要な3D幾何を暗黙のうちにしか扱えなかった。GAMは事前学習済みのGFMをそのまま利用し、中間層での分割と因果的未来予測器の挿入という最小限の変更で、言語条件付きの時間的世界モデリングを実現する。このアプローチは、大規模な基盤モデルの幾何学的な事前知識を保持しつつ、将来の幾何と行動を単一バックボーンで生成する点で新規性がある。 本紙の過去報道との接続はないが、ロボット学習分野では基盤モデルの活用が進んでおり、GAMはその流れの中で幾何情報を明示的に扱う点で差別化を図る。業界構造への含意としては、ロボットの操作タスクにおいて、2Dベースのモデルから3D幾何を考慮したモデルへの移行が進む可能性がある。また、GAMが軽量で高速であるとされる点は、実ロボットへの展開やエッジデバイスでの推論に有利に働く可能性がある。 未確定の論点としては、論文で報告されたベンチマークの詳細な条件や、実ロボットでの汎化性能、学習データの規模と質が挙げられる。また、GAMが他の基盤モデルと比較してどの程度の優位性を持つのか、第三者による再現実験や追加評価が待たれる。
なぜ重要か
GAMは、ロボット政策学習において3D幾何を明示的に扱う新しい手法を示した。これにより、接触を伴う操作タスクの精度向上が期待される。また、既存の基盤モデルを再利用するアプローチは、計算資源やデータの効率化につながる可能性があり、ロボット学習の実用化を後押しするだろう。