何が起きたか
研究チームは2026年2月17日、arXivにプレプリント『World Action Models are Zero-shot Policies』を公開し、動画拡散モデルを基盤とする世界行動モデルDreamZeroを提案した。実ロボット実験で、最先端のVLAモデルと比較して新タスク・環境への汎化が2倍以上向上したと報告している。
詳細
DreamZeroは、事前学習済みの動画拡散モデルを基盤とし、将来の世界状態と行動を予測することで物理ダイナミクスを学習する。VLAモデルとは異なり、繰り返しのデモンストレーションに依存せず、異種ロボットデータから多様なスキルを学習できるとしている。モデルとシステムの最適化により、14Bの自己回帰動画拡散モデルを7Hzでリアルタイム閉ループ制御することを可能にした。また、クロスエンボディメント転送として、他のロボットや人間からのビデオのみのデモンストレーションで、未見タスクの性能が10〜20分のデータで42%以上相対的に向上したと報告。さらに、30分のプレイデータで新しいエンボディメントへの数ショット適応を実現しつつ、ゼロショット汎化を保持したとしている。
Key Facts
| DreamZeroは、事前学習済みの動画拡散モデルを基盤とする世界行動モデルである。 | 出典一覧 |
| 実ロボット実験で、最先端のVLAモデルと比較して新タスク・環境への汎化が2倍以上向上した。 | 出典一覧 |
| 14Bの自己回帰動画拡散モデルを7Hzでリアルタイム閉ループ制御することを可能にした。 | 出典一覧 |
| ビデオのみのデモンストレーションで、未見タスクの性能が10〜20分のデータで42%以上相対的に向上した。 | 出典一覧 |
| 30分のプレイデータで新しいエンボディメントへの数ショット適応を実現しつつ、ゼロショット汎化を保持した。 | 出典一覧 |
本紙の見方
今回の発表は、ロボット学習におけるパラダイム転換を示唆する。従来のVLAモデルは意味的汎化に優れる一方、未見の物理的動作への汎化に課題があった。DreamZeroは動画拡散モデルを基盤とし、世界の進化を密に表現するビデオを介して物理ダイナミクスを学習することで、この課題を克服しようとするものだ。特に、14B規模のモデルを7Hzでリアルタイム制御できるようにした点は、実用化への大きな一歩とみられる。また、クロスエンボディメント転送の実証は、データ収集の効率化に寄与する可能性がある。一方で、論文はプレプリントであり、実験の詳細や再現性は今後の検証が待たれる。また、7Hzという制御周波数が実タスクに十分かどうか、また、大規模モデルの計算コストを実運用でどう扱うかが焦点になる。
なぜ重要か
DreamZeroは、ロボットの汎化性能を飛躍的に高める可能性を秘めており、産業用ロボットから家庭用ロボットまで幅広い応用が期待される。特に、データ効率の高い学習方法は、実世界でのロボット導入コストを下げる可能性がある。今後の実証実験やオープンソース化の動向が注目される。