何が起きたか
研究チームは2025年12月1日、arXivに論文を公開し、オフポリシー強化学習アルゴリズム「FastSAC」と「FastTD3」を用いて、Unitree G1とBooster T1のヒューマノイドロボットの歩行制御を15分で学習できると発表した。単一のRTX 4090 GPUで数千の並列環境を利用する。
詳細
論文は、大規模並列シミュレーションによりロボットの強化学習トレーニング時間を日単位から分単位に短縮できると述べる。提案手法は、オフポリシーRLアルゴリズムを大規模に安定化させる設計選択と最小限の報酬関数を用いる。強いドメインランダム化(ランダム化されたダイナミクス、不整地、押し外乱)の下で、Unitree G1とBooster T1のエンドツーエンドの歩行制御学習を実証した。また、全身の人間動作追跡ポリシーの高速トレーニングも示す。コードと動画は公開されている。
Key Facts
| 研究チームはオフポリシーRLアルゴリズムFastSACとFastTD3を導入し、単一のRTX 4090 GPUで15分のトレーニングでヒューマノイド歩行ポリシーを学習できるとしている。 | [1] |
| 提案手法はUnitree G1とBooster T1ロボットで実証された。 | [1] |
| 論文は2025年12月1日にarXivで公開された。 | [1] |
| 研究では強いドメインランダム化(ランダム化されたダイナミクス、不整地、押し外乱)の下でエンドツーエンドの学習を実証している。 | [1] |
| コードと動画はhttps://younggyo.me/fastsac-humanoidで公開されている。 | [1] |
なぜ重要か
ヒューマノイドの歩行制御学習が15分で可能になれば、開発サイクルが劇的に短縮され、ロボットの実用化が加速する可能性がある。また、Unitreeのハードウェアが研究で活用されることで、同社の技術力が評価される契機となる。