何が起きたか

arXivに2025年5月24日付で公開された論文「DreamPolicy: A Unified World-model Policy for Scalable Humanoid Locomotion」において、研究チームは人型ロボットの歩行制御のための統一フレームワーク「DreamPolicy」を提案した。このフレームワークは、オフラインデータと拡散ベースのワールドモデルを統合し、単一のポリシーで既知および未知の地形の両方に対応できるとしている。実験では、未見の地形で最強のベースラインを最大27%、複合地形で38%上回る性能を示した。

詳細

従来の手法は、複数の地形特化型ティーチャーポリシーを蒸留して単一の学生ポリシーに統合することが多い。しかし、この蒸留アプローチは基本的な歩行プリミティブを捉える一方で、複雑な環境に適応するためにスキルを有機的に構成することが難しく、訓練中に見られない新規の複合地形への汎化が不十分であると論文は指摘する。 DreamPolicyは、自己回帰拡散ワールドモデルを用いた地形認識型ワールドモデルを中核とし、専門ポリシーからの集約ロールアウトで訓練される。このモデルは物理的に妥当な将来軌道を合成し、条件付きポリシーの動的目標として機能するため、手動の報酬設計を不要にする。蒸留とは異なり、ワールドモデルは汎化可能な歩行スキルを捉え、未見の複合地形へのゼロショット転送を可能にする。 DreamPolicyはデータ可用性に応じて自然にスケールし、オフラインデータセットが拡大するにつれて拡散ワールドモデルはより豊富なスキルを継続的に獲得する。論文は、ワールドモデルベースの計画とポリシー学習を統合することで、「1タスク1ポリシー」のボトルネックを打破し、汎用人型制御のためのスケーラブルでデータ駆動型のパラダイムを確立すると結論付けている。

Key Facts

論文タイトルは「DreamPolicy: A Unified World-model Policy for Scalable Humanoid Locomotion」で、arXivに2025年5月24日付で公開された。[1]
DreamPolicyはオフラインデータと拡散ベースのワールドモデルを統合し、単一のポリシーで既知・未知の地形を習得する。[1]
従来手法は複数の地形特化型ティーチャーポリシーを蒸留して単一の学生ポリシーに統合するが、新規の複合地形への汎化が不十分である。[1]
DreamPolicyは自己回帰拡散ワールドモデルを用いた地形認識型ワールドモデルを採用し、専門ポリシーからの集約ロールアウトで訓練される。[1]
ワールドモデルは物理的に妥当な将来軌道を合成し、条件付きポリシーの動的目標として機能するため、手動の報酬設計を不要にする。[1]
蒸留とは異なり、ワールドモデルは汎化可能な歩行スキルを捉え、未見の複合地形へのゼロショット転送を可能にする。[1]
実験では、DreamPolicyは未見の地形で最強のベースラインを最大27%、複合地形で38%上回った。[1]
DreamPolicyはデータ可用性に応じてスケールし、オフラインデータセットの拡大に伴い拡散ワールドモデルはより豊富なスキルを獲得する。[1]

なぜ重要か

この研究は、人型ロボットの歩行制御において「1タスク1ポリシー」の制約を打破し、データ駆動型の汎用制御への道を開く可能性がある。拡散ワールドモデルによるゼロショット転送は、実世界の多様な環境への適応を促進し、ロボットの実用化に貢献すると期待される。