何が起きたか

2026年8月26日にarXivで公開された論文で、カメラ中心の統一行動表現UCAG-Pが提案された。UCAG-Pは、ロボットアーム・ヒューマノイド・人間の手を共通の行動スキーマの異なる実施形態とみなし、画像・カメラ座標系でのアンカー動作として操作を表現する。訓練データはロボット・シミュレーションデータ4.03K時間と人間のデモ2.34K時間で、単一チェックポイントがLIBEROで98.3%、RoboTwin Easy/Hardで88.7%/89.2%、LIBERO-Plusでゼロショット82.0%、RoboCasa GR-1で62.0%を達成した。

詳細

UCAG-Pは、異種の具現化データを構造的に整列させるカメラ中心の統一行動表現を導入する。ロボット固有のコマンドを共有ポリシーのターゲットとする代わりに、画像・カメラ座標系でのカメラ観測可能なアンカー動作として操作を表現し、ロボットアーム・ヒューマノイド・人間の手を共通の行動スキーマの異なる実施形態として扱う。幾何条件付き行動トランスレータが、予測された動作とターゲット実施形態の運動学を組み合わせて実行可能な制御を生成する。この分離アーキテクチャにより、共有VLAポリシーは転移可能な操作幾何学を学習しつつ、実施形態固有の制御可能性を保持する。訓練データはロボット・シミュレーションデータ4.03K時間と人間のデモ2.34K時間。単一チェックポイントで、LIBERO 98.3%、RoboTwin Easy 88.7%、RoboTwin Hard 89.2%、LIBERO-Plus ゼロショット82.0%、RoboCasa GR-1 62.0%を達成。ベンチマーク固有のファインチューニングは行っていない。

Key Facts

UCAG-Pは、カメラ中心の統一行動表現により異種の具現化データを構造的に整列させる。[1]
訓練データはロボット・シミュレーションデータ4.03K時間と人間のデモ2.34K時間。[1]
単一チェックポイントでLIBERO 98.3%、RoboTwin Easy 88.7%、RoboTwin Hard 89.2%、LIBERO-Plus ゼロショット82.0%、RoboCasa GR-1 62.0%を達成。[1]
ベンチマーク固有のファインチューニングなしでこれらの結果を達成。[1]
幾何条件付き行動トランスレータが予測動作とターゲット実施形態の運動学を組み合わせて実行可能な制御を生成する。[1]

本紙の見方

UCAG-Pの核心は、異種ロボットのデータを統一するための『カメラ中心の行動表現』という発想の転換にある。従来のVLAポリシーは、ロボット固有のコマンドを共有ターゲットとすることで、形態の違いを吸収しようとしてきたが、UCAG-Pは操作をカメラで観測可能なアンカー動作として表現し、ロボットアーム・ヒューマノイド・人間の手を共通スキーマの変種とみなす。これにより、データセット固有の適応分岐や明示的なリターゲティングを必要とせず、単一のポリシーで複数の実施形態を扱える点が新しい。 このアプローチは、ロボット学習におけるデータ不足という根本的な問題に対する一つの解答を示す。ロボットの実データは収集コストが高く、形態ごとに異なるため、大規模なデータセットを構築するのは困難だ。UCAG-Pは人間のデモデータを直接活用できるため、データの多様性を大幅に拡張できる。実際、訓練データのうち2.34K時間が人間のデモであり、これはロボットデータの約58%に相当する。この比率は、人間の動作データをロボット学習に転用する可能性を示唆している。 業界構造への含意として、UCAG-Pのような統一表現は、ロボットメーカー間のデータ共有を促進する可能性がある。現在、各社が独自のデータ形式で学習しているため、データの相互利用は難しいが、カメラ中心の表現はハードウェアに依存しないため、異なるメーカーのロボット間でデータを共有しやすくなる。これは、ロボットの基盤モデル開発において、データの規模が競争力を左右する中で、重要な意味を持つ。 一方で、未確定の論点もある。UCAG-Pはシミュレーションと実ロボットの混合データで訓練されているが、実環境での汎化性能は未知数だ。また、カメラ中心の表現は、カメラの視点に依存するため、カメラ配置が異なる環境での性能がどうなるかは検証が必要である。さらに、行動トランスレータが運動学に依存するため、複雑な運動学を持つロボットへの適用は課題が残る。これらの点は、今後の研究で明らかにされるべきだ。

なぜ重要か

UCAG-Pは、異種ロボットデータを統一するための具体的な方法論を提示し、VLAポリシーのスケーリングにおけるデータのボトルネックを緩和する可能性を示した。これは、ロボット基盤モデルの開発競争において、データ戦略の重要性を再認識させるものであり、今後のロボット学習の方向性に影響を与えるだろう。