何が起きたか
研究チームは2026年8月29日、世界行動モデル「Hydra」を発表した。Hydraは、視覚状態・物理姿勢・制御アクションを統一した潜在多様体上で圧縮し、離散的な運動力学的意図と視覚状態の語彙を形成する。プランナーをモデル内部に組み込むことで、ピクセル空間へのデコードを不要にし、実時間制御のボトルネックを解消した。2つの物理ロボットプラットフォームでの評価では、目標指向計画で最先端の世界モデルを上回り、閉ループ実行では主要な反応型基盤ポリシーと同等以上の性能を示した。
詳細
Hydraは、視覚状態、物理姿勢、制御アクションを統一した潜在多様体を確立し、モダリティ固有のベクトル量子化ボトルネックを通じて、運動力学的意図と視覚状態の離散語彙に圧縮する。プランナーはこの共有多様体から直接候補をサンプリングし、運動学的・知覚的コスト(Kinematic-Perceptual Cost)でランク付けする。離散的な意図だけでは物理的な実行に必要な滑らかな連続コマンドを供給できないため、条件付きFlow Matchingを用いて選択された意図を連続軌道にマッピングする。評価は2つの物理ロボットプラットフォームで実施された。
Key Facts
| Hydraは、視覚状態・物理姿勢・制御アクションを統一した潜在多様体を確立し、モダリティ固有のベクトル量子化ボトルネックで離散語彙に圧縮する。 | [1] |
| プランナーをモデル内部に組み込み、候補を共有多様体から直接サンプリングし、運動学的・知覚的コストでランク付けする(離散潜在計画、DLP)。 | [1] |
| DLPと条件付きFlow Matchingを組み合わせ、選択された意図を連続軌道にマッピングして実行する。 | [1] |
| 2つの物理ロボットプラットフォームで評価し、目標指向計画で最先端の世界モデルを上回った。 | [1] |
| 閉ループ実行では、主要な反応型基盤ポリシーと同等以上の性能を示した。 | [1] |
本紙の見方
Hydraの核心は、世界モデルとプランナーの表現の不一致を解消した点にある。従来の世界モデルは、生成モデルとプランナーが分離した多様体上で動作するため、プランナーは候補をピクセル空間にデコードして評価する必要があり、実時間制御の大きな障害となっていた。Hydraはプランナーをモデル内部に組み込み、統一された潜在多様体上で計画することで、このデコードを不要にした。 この設計は、ロボットの制御アーキテクチャにおける垂直統合の一形態とみなせる。Hydraは、視覚状態・物理姿勢・制御アクションを同一の潜在空間に埋め込み、離散的な意図の語彙を学習する。これにより、プランナーはモデル自身の観測理解に基づいて候補をサンプリングでき、評価も離散空間内で完結する。 さらに、離散計画だけでは物理的な実行に必要な滑らかな連続コマンドを生成できないため、条件付きFlow Matchingを併用する。このハイブリッドアプローチは、離散的な高次計画と連続的な低次制御のギャップを埋めるものであり、実世界のロボット制御における重要な進展である。 評価は2つの物理ロボットプラットフォームで行われ、目標指向計画では最先端の世界モデルを上回り、閉ループ実行では主要な反応型基盤ポリシーと同等以上の性能を示した。これは、Hydraが単なるシミュレーション上の成果ではなく、実機での有効性を実証したことを意味する。 今後の論点としては、Hydraのスケーラビリティが挙げられる。潜在多様体の次元や語彙サイズが増えた場合に、計画の品質と計算コストがどう変化するかは未検証である。また、多様なロボットプラットフォームやタスクへの一般化性能も確認が必要だ。さらに、Flow Matchingの学習に必要なデータ量や、実時間制御におけるレイテンシの実測値も公開されていない。
なぜ重要か
Hydraは、世界モデルを実時間制御に活用する際の根本的な障壁を克服した点で重要である。プランナーをモデル内部に統合し、ピクセル空間へのデコードを排除することで、物理ロボット上でのリアルタイムな目標指向計画が現実的になった。これは、ロボットの知覚・計画・制御を統合する新たなアーキテクチャの可能性を示す。