何が起きたか

研究チームは、ロボットのアクションを画素運動として表現する汎用ワールドモデル「Hydra-0」を発表した。このモデルは、アクションフローと呼ばれる共有視覚インターフェースを用いて、異なるロボット、タスク、環境、ビデオ生成バックボーンにわたってアクションの結果を学習する。論文はarXivに2026年8月18日に公開された。

詳細

Hydra-0は、ロボットのアクションを画素運動として表現することで、汎用的なワールドモデリングと制御を実現する。この共有視覚インターフェースにより、異なる実施形態、タスク、環境、ビデオ生成バックボーンにわたってアクションの結果を学習できるとしている。 ベスト構成では、アクション条件付きベースラインと比較して、ロボット動作誤差を90.4%、物体動作誤差を60.2%低減した。また、ゼロショット合成とデータ効率的な適応をサポートする。RoboLabベンチマークでは、リプレイと参照の成功率の間のピアソン相関がr=0.96を達成した。 さらに、このインターフェースの創発的な逆モードも発見された。これは、人間のデモンストレーションから転送された所望の物体フローから、互換性のあるロボット動作を予測するワールドアクションモデルである。訓練されたアクションヘッドは、結果として得られる潜在特徴を実行可能なアクションに変換し、タスク固有の専門家ロボットデモンストレーションを必要としない。

Key Facts

Hydra-0は、ロボットのアクションを画素運動として表現する汎用ワールドモデルである。出典一覧
Hydra-0は、アクションフローと呼ばれる共有視覚インターフェースを使用する。出典一覧
ベスト構成では、アクション条件付きベースラインと比較して、ロボット動作誤差を90.4%低減した。出典一覧
ベスト構成では、アクション条件付きベースラインと比較して、物体動作誤差を60.2%低減した。出典一覧
Hydra-0は、ゼロショット合成とデータ効率的な適応をサポートする。出典一覧
RoboLabベンチマークで、リプレイと参照の成功率の間のピアソン相関がr=0.96を達成した。出典一覧
創発的な逆モードとして、ワールドアクションモデルが人間のデモンストレーションから転送された物体フローからロボット動作を予測する。出典一覧
訓練されたアクションヘッドは、潜在特徴を実行可能なアクションに変換し、タスク固有の専門家ロボットデモンストレーションを必要としない。出典一覧

なぜ重要か

Hydra-0は、ロボットのアクションを画素運動として表現することで、異なるロボットやタスクを横断した学習を可能にする可能性がある。これにより、ロボット制御の汎用性が向上し、データ効率的な適応やゼロショット合成が実現できると期待される。