何が起きたか

2026年6月15日にarXivで公開された論文「Geometric Action Model for Robot Policy Learning」において、研究チームは言語条件付き操作ポリシーGAMを発表した。GAMは事前学習済みの幾何基盤モデルを中間層で分割し、浅い層を観測エンコーダ、分割層に挿入した因果的未来予測器が言語・プロプリオセプション・行動履歴に基づき未来の潜在トークンを予測する。予測されたトークンは残りのGFMブロックを通じて特徴伝播とデコードに使われ、単一バックボーンで未来の幾何と行動を生成する。

詳細

GAMは、言語条件付き操作ポリシーであり、事前学習済みの幾何基盤モデルを直接再利用する。GFMを中間層で分割し、浅い層を観測エンコーダとして使用し、分割層に因果的未来予測器を挿入する。この予測器は、言語、プロプリオセプション、行動履歴に条件付けられて未来の潜在トークンを予測する。予測された未来トークンは、残りのGFMブロックを通じて特徴伝播とデコードに供され、単一のバックボーンが未来の幾何と行動の両方を生成する。この設計により、最小限のアーキテクチャ変更でGFMに言語条件付きの時間的世界モデリングを装備し、幾何学的な事前知識を保持する。

Key Facts

GAMは、事前学習済みの幾何基盤モデルを直接再利用する言語条件付き操作ポリシーである。[1]
GAMはGFMを中間層で分割し、浅い層を観測エンコーダとして使用する。[1]
分割層に挿入された因果的未来予測器が、言語・プロプリオセプション・行動履歴に基づき未来の潜在トークンを予測する。[1]
予測された未来トークンは残りのGFMブロックを通じて特徴伝播とデコードに使われ、単一バックボーンで未来の幾何と行動を生成する。[1]
シミュレーションと実ロボットの操作ベンチマークで、GAMは既存の基盤モデル規模のベースラインより高精度・高ロバスト・高速・軽量であるとされる。[1]

なぜ重要か

GAMは、ロボット政策学習において3D幾何を明示的に扱う新しい手法を示した。これにより、接触を伴う操作タスクの精度向上が期待される。また、既存の基盤モデルを再利用するアプローチは、計算資源やデータの効率化につながる可能性があり、ロボット学習の実用化を後押しするだろう。