何が起きたか
研究チームは2026年8月29日、arxiv.orgでAnyWorldを発表した。AnyWorldは、人間の一人称視点映像をロボット固有のロールアウトに変換するクロスエンボディメント世界モデルである。単一の人間のインタラクションを行動・カメラ・身体の要素に分解し、それらを独立に再構成することで、ペアの人間-ロボットデモなしに多様なロボット経験を生成する。実験では、RoboCasa GR1テーブルトップベンチマークと実機IRONヒューマノイドで操作性能の向上を確認した。
詳細
AnyWorldは、インタラクションを行動制御、カメラ制御、ターゲット身体コンテキストの3要素に分解する。行動制御は動作構造を、カメラ制御は視点の変化を、身体コンテキストは動作する身体とそのインタラクション幾何を定義する。これにより、身体・視点・シーンの要素を独立に再構成でき、単一モデルで多くのロボットドメイン経験を生成できる。モデルは大規模な人間インタラクションの事前学習と、混合身体のファインチューニングで訓練される。実験では、身体・視点・シーンの再構成が可能であることを示し、生成データがRoboCasa GR1ベンチマークと実機IRONヒューマノイドの操作性能を向上させることを実証した。さらに、ペアのない人間経験をロボット固有のビデオ-行動ペアに再構成し、ポリシーのギャップをターゲットにできるかをテストした。IRONでの制御介入は、誤った完了事前分布を修正し、言語に基づく空間ターゲット選択を確立した。行動のみの反事実介入は後者を確実に学習できず、行動較正と視覚的再構成の両方が必要であることを示した。
Key Facts
| AnyWorldは、人間の一人称視点映像をロボット固有のロールアウトに変換するクロスエンボディメント世界モデルである。 | [1] |
| モデルはインタラクションを行動制御、カメラ制御、身体コンテキストの3要素に分解し、独立に再構成する。 | [1] |
| 大規模な人間インタラクションの事前学習と混合身体のファインチューニングで訓練される。 | [1] |
| 生成データはRoboCasa GR1テーブルトップベンチマークと実機IRONヒューマノイドの操作性能を向上させた。 | [1] |
| IRONでの制御介入は、誤った完了事前分布を修正し、言語に基づく空間ターゲット選択を確立した。 | [1] |
本紙の見方
AnyWorldの提案は、ロボット学習におけるデータ不足という根本的なボトルネックに、世界モデルという枠組みで対処する点で新規性が高い。従来の模倣学習は、ロボット固有のデモデータを大量に収集する必要があったが、AnyWorldは人間の映像を入力として、ロボット固有のロールアウトを生成する。これにより、データ収集のコストを大幅に削減できる可能性がある。 本稿の関連記事は存在しないが、ロボット学習分野では、シミュレーションから実機への転移や、データ拡張の手法が盛んに研究されている。AnyWorldは、人間の映像をシミュレーションデータの代替として利用する点で、これらの研究と一線を画す。特に、行動・カメラ・身体の要素を分解し、再構成するというアプローチは、従来のデータ拡張とは異なり、身体の違いを明示的にモデル化している。 業界構造への含意として、AnyWorldはロボット学習のデータ収集の在り方を変える可能性がある。現在、ロボット学習のデータは、実機でのデモ収集やシミュレーション環境の構築に依存しているが、AnyWorldは人間の映像を活用することで、データ収集のハードルを下げる。これは、ロボット学習の民主化につながる可能性がある。また、世界モデルが生成するデータは、実機での追加学習に利用できるため、ロボットの汎用性向上に寄与する。 未確定の論点として、AnyWorldが生成するデータの品質が、実際のロボット学習にどの程度影響するかは、まだ検証が必要である。実験ではRoboCasaとIRONで性能向上が確認されたが、他のタスクやロボットでの汎用性は不明である。また、生成データの多様性や、実世界の複雑な環境での有効性も今後の課題である。さらに、行動較正と視覚的再構成の両方が必要であることが示されたが、そのバランスや、より効率的な再構成方法の探求も必要であろう。
なぜ重要か
AnyWorldは、ロボット学習のデータ収集コストを削減し、人間の映像を活用した新たな学習パラダイムを提示する。これにより、ロボットの汎用性向上と、ロボット学習の民主化が進む可能性がある。