何が起きたか
ヒューマノイドの家事タスクでは、移動・姿勢調整・バランス維持・物体操作を同時に行う「同時移動操作」が求められるが、既存手法は移動と操作を分離するか、腕中心または映像中心の世界行動モデルに留まっていた。新たに提案された「ω-0」は、言語指示・現在の視覚観測・ロボットの自己受容感覚から、コントローラ互換の全身行動潜在変数を直接予測する。将来の映像を再構成する代わりに、将来の観測埋め込みを軽量な予測目的として学習し、潜在的な視覚予測と拡散ベースの全身行動生成を結合する。入力は一人称RGB・三人称RGB・三人称深度に対応し、コントローラベースのシミュレーションリプレイにより、人間や公開の視覚・動作プリエをロボット実行可能な行動潜在変数に接地する。さらに、同期マルチビュー観測・全身SMPLモーション・ロボット状態・行動潜在変数を含む40時間超の実世界データセット「ω-HOME」を収集。実世界の11種の家事タスクで、単一のω-0モデルが滑らかな「移動しながら操作」行動を生成し、代表的な模倣学習・VLA・ヒューマノイド・WAMベースラインを一貫して上回った。
Key Facts
| ω-0は、言語指示・現在の視覚観測・ロボットの自己受容感覚から、コントローラ互換の全身行動潜在変数を直接予測する潜在予測型世界行動モデルである。 | [0] |
| ω-0は将来の映像を再構成せず、コンパクトな将来観測埋め込みを軽量な予測目的として学習し、潜在的な視覚予測と拡散ベースの全身行動生成を結合する。 | [0] |
| ω-0は一人称RGB・三人称RGB・三人称深度の入力に対応し、コントローラベースのシミュレーションリプレイにより人間や公開の視覚・動作プリエをロボット実行可能な行動潜在変数に接地する。 | [0] |
| 40時間超の実世界データセット「ω-HOME」が収集され、同期マルチビュー観測・全身SMPLモーション・ロボット状態・行動潜在変数を含む。 | [0] |
| 実世界の11種の家事タスクで、単一のω-0モデルが滑らかな移動しながら操作行動を生成し、代表的な模倣学習・VLA・ヒューマノイド・WAMベースラインを一貫して上回った。 | [0] |
なぜ重要か
ヒューマノイドロボットの家事応用では、移動と操作の同時実行が不可欠だが、従来は分離されていた。ω-0は、将来の映像再構成を避けつつ潜在的な視覚予測と行動生成を統合する新しいアーキテクチャを示し、実世界の複数タスクで既存手法を凌駕した。これにより、ヒューマノイドの全身協調制御と実世界展開の可能性が大きく前進し、今後の家庭用ロボットやサービスロボットの開発に影響を与えるとみられる。