何が起きたか
研究チームは2026年2月17日、arXivにプレプリント『World Action Models are Zero-shot Policies』を公開し、動画拡散モデルを基盤とする世界行動モデルDreamZeroを提案した。実ロボット実験で、最先端のVLAモデルと比較して新タスク・環境への汎化が2倍以上向上したと報告している。
詳細
DreamZeroは、事前学習済みの動画拡散モデルを基盤とし、将来の世界状態と行動を予測することで物理ダイナミクスを学習する。VLAモデルとは異なり、繰り返しのデモンストレーションに依存せず、異種ロボットデータから多様なスキルを学習できるとしている。モデルとシステムの最適化により、14Bの自己回帰動画拡散モデルを7Hzでリアルタイム閉ループ制御することを可能にした。また、クロスエンボディメント転送として、他のロボットや人間からのビデオのみのデモンストレーションで、未見タスクの性能が10〜20分のデータで42%以上相対的に向上したと報告。さらに、30分のプレイデータで新しいエンボディメントへの数ショット適応を実現しつつ、ゼロショット汎化を保持したとしている。
Key Facts
| DreamZeroは、事前学習済みの動画拡散モデルを基盤とする世界行動モデルである。 | [1] |
| 実ロボット実験で、最先端のVLAモデルと比較して新タスク・環境への汎化が2倍以上向上した。 | [1] |
| 14Bの自己回帰動画拡散モデルを7Hzでリアルタイム閉ループ制御することを可能にした。 | [1] |
| ビデオのみのデモンストレーションで、未見タスクの性能が10〜20分のデータで42%以上相対的に向上した。 | [1] |
| 30分のプレイデータで新しいエンボディメントへの数ショット適応を実現しつつ、ゼロショット汎化を保持した。 | [1] |
なぜ重要か
DreamZeroは、ロボットの汎化性能を飛躍的に高める可能性を秘めており、産業用ロボットから家庭用ロボットまで幅広い応用が期待される。特に、データ効率の高い学習方法は、実世界でのロボット導入コストを下げる可能性がある。今後の実証実験やオープンソース化の動向が注目される。