何が起きたか
2023年9月30日に公開された論文「AdaptNet: Policy Adaptation for Physics-Based Character Control」で、AdaptNetという手法が提案された。この手法は、既存の強化学習コントローラの潜在空間を修正し、新しい行動をゼロから学習するよりも迅速に学習できるようにする。AdaptNetは2層の階層構造を用いて、元の状態埋め込みを拡張し、行動の小幅な変更に対応するとともに、ポリシーネットワーク層を修正してより大きな変更を実現する。
詳細
AdaptNetは、人間が新しいスキルを学ぶ際に既存のスキルを適応させる能力に着想を得ている。既存のポリシーを基盤とし、2層の階層を構築する。第1層は元の状態埋め込みを拡張して行動の小幅な変更をサポートし、第2層はポリシーネットワーク層を修正してより実質的な変更を行う。 この手法は、移動の新しいスタイル、新しいタスク目標、キャラクタの形態変化、環境の広範な変化など、多様な適応シナリオで効果が示されている。また、ゼロから学習する場合や他の既存ポリシー修正手法と比較して、トレーニング時間が大幅に短縮され、学習効率が顕著に向上すると報告されている。 コードはhttps://motion-lab.github.io/AdaptNetで公開されている。
Key Facts
| AdaptNetは、既存の強化学習コントローラの潜在空間を修正する手法である。 | [1] |
| AdaptNetは2層の階層構造を用いる。 | [1] |
| AdaptNetは移動の新しいスタイル、新しいタスク目標、キャラクタの形態変化、環境の広範な変化に適応できる。 | [1] |
| AdaptNetは学習効率が大幅に向上し、トレーニング時間が大幅に短縮される。 | [1] |
| コードはhttps://motion-lab.github.io/AdaptNetで公開されている。 | [1] |
なぜ重要か
物理ベースのキャラクタ制御において、新しい行動を学習する際の効率を大幅に向上させる可能性がある。既存のポリシーを適応させることで、ゼロから学習するよりも短時間で多様な変化に対応できるため、アニメーションやロボティクス分野での応用が期待される。