何が起きたか

研究チームは2026年2月6日、arxiv.orgにて、44k時間の人間の一人称視点動画から学習する基盤世界モデルDreamDojoを発表した。同モデルは、連続潜在アクションを導入し、ラベルなし動画からの知識転移を実現、蒸留パイプラインによりリアルタイム推論(10.81 FPS)を達成した。

詳細

DreamDojoは、44k時間の一人称視点の人間動画から多様な相互作用と器用な制御を学習する基盤世界モデルである。データ混合は世界モデルの事前学習用ビデオデータセットとして最大規模とされ、多様な日常シナリオ、物体、スキルを網羅する。アクションラベルの不足に対処するため、連続潜在アクションを統一的な代理アクションとして導入し、ラベルなし動画からの相互作用知識の転移を強化する。小規模なターゲットロボットデータでのポストトレーニング後、物理の理解と正確なアクション制御を示す。蒸留パイプラインにより、DreamDojoをリアルタイム速度(10.81 FPS)に高速化し、コンテキストの一貫性をさらに向上させる。

Key Facts

DreamDojoは44k時間の一人称視点の人間動画から学習する基盤世界モデルである。[1]
連続潜在アクションを導入し、ラベルなし動画からの知識転移を実現した。[1]
蒸留パイプラインにより、リアルタイム速度10.81 FPSを達成した。[1]
データ混合は世界モデルの事前学習用ビデオデータセットとして最大規模とされる。[1]
小規模なターゲットロボットデータでのポストトレーニング後、物理の理解と正確なアクション制御を示す。[1]

本紙の見方

今回の発表は、ロボットの世界モデル研究における一つの節目と位置づけられる。従来の世界モデルは、ロボットの実データやシミュレーションデータに依存することが多く、データの不足が課題だった。DreamDojoは、人間の動画という大規模で多様なデータソースを活用し、アクションラベルなしで学習する点が新しい。特に、連続潜在アクションという代理アクションを導入することで、ラベルなし動画からの知識転移を可能にした点は、データ不足という根本的な問題への対処として注目に値する。 本紙の過去報道との接続は、関連記事が提供されていないため直接的な言及は避けるが、ロボット学習におけるデータ効率の向上は業界全体のトレンドであり、今回の手法はその流れを加速させる可能性がある。 業界構造への含意としては、世界モデルの学習に人間の動画を活用するアプローチは、ロボット企業にとってデータ収集のコストを大幅に削減する可能性がある。特に、器用な操作を必要とするタスクでは、実ロボットでのデータ収集は高コストであり、人間の動画を活用できれば、開発のスピードとスケールが向上する。また、蒸留によるリアルタイム推論の実現は、実機での応用(テレオペレーションやポリシー評価)への道を開く。 未確定の論点としては、DreamDojoの実ロボットへの適用時の性能が挙げられる。論文ではOODベンチマークでの評価が行われているが、実際のロボットでの動作は未検証である。また、44k時間の動画データの具体的な内容や、データのバイアスがモデルの性能に与える影響も不明である。さらに、蒸留による高速化がどの程度の精度低下を伴うのかも確認が必要である。

なぜ重要か

DreamDojoは、ロボットの世界モデル学習におけるデータ不足という課題に対して、人間の動画を大規模に活用する新たな道を示した。これは、ロボットの汎用性向上に寄与する可能性があり、今後のロボット開発のコスト構造を変える可能性がある。