arXiv:2301.04104
Mastering Diverse Domains through World Models
Mastering Diverse Domains through World Models
🏛 フィジカルAI 必読論文強化学習・制御・世界モデル
本論文は、DeepMindの研究チームによって2023年に発表されたDreamerV3を提案したものである。これは、強化学習エージェントが多様なドメイン(2Dゲーム、3Dゲーム、ロボット操作、迷路探索など)を単一のアルゴリズムで学習できるようにする、世界モデルに基づく汎用エージェントである。従来のモデルフリー強化学習手法は、報酬が疎な環境や高次元の観測に対して不安定であり、ドメインごとにハイパーパラメータを調整する必要があった。DreamerV3は、環境のダイナミクスを学習する世界モデルを内部に構築し、そのモデル上で想像上の軌跡を生成して方策を学習することで、この問題を解決した。
仕組みの核となるのは、潜在空間における再帰型状態空間モデル(RSSM)である。エージェントは観測を潜在変数にエンコードし、その潜在空間で遷移を予測する。この世界モデルは、画像再構成、状態予測、報酬予測の3つの損失を同時に最適化して学習される。次に、学習した世界モデルを用いて、エージェントは想像上の環境でロールアウトを行い、その軌跡から方策と価値関数を学習する。この際、DreamerV3は「自由な報酬スケーリング」という手法を導入し、報酬の絶対値に依存せず、報酬の移動平均と標準偏差で正規化することで、報酬のスケールが異なるタスクでも安定して学習できるようにした。また、勾配クリッピングや大きなネットワーク容量など、頑健性を高める設計が随所に取り入れられている。
この論文が画期的なのは、単一のハイパーパラメータ設定で、Atari 100kベンチマーク、Minecraft、DMLab、ロボット操作タスクなど、150以上のタスクで人間を超えるか同等の性能を達成した点である。特に、報酬が極めて疎なMinecraftのダイヤモンド採掘タスクでは、従来手法が全く学習できなかったのに対し、DreamerV3はゼロから学習してダイヤモンドを入手することに成功した。これは、世界モデルが環境の構造を効率的に学習し、想像上の経験を活用することで、現実の試行錯誤を減らせることを示している。また、報酬のスケーリング問題を解決したことで、タスクごとの調整が不要になり、汎用性が飛躍的に向上した。
フィジカルAIの観点では、DreamerV3はロボットが実世界で試行錯誤する前に、内部モデルで計画を立てる能力を示した点で重要である。実ロボットでは試行回数が限られるため、世界モデルによる想像上の学習はサンプル効率を大幅に改善する。その後、DreamerV3はロボット操作やナビゲーションの研究に広く応用され、モデルベース強化学習の標準的なベースラインとなった。また、世界モデルが環境の因果構造を捉えることで、将来のロボットが物理法則を内部に獲得し、未知の状況でも柔軟に行動するための基盤となると考えられる。この論文は、強化学習とロボティクスの橋渡しとして、フィジカルAIの実現に向けた重要な一歩である。
※ 解説はAIが生成。被引用数はOpenAlex由来(取得できた論文のみ表示)。詳細は原論文をご確認ください。
分類: landmark