何が起きたか

研究チームは2025年12月1日、arXivに論文を公開し、オフポリシー強化学習アルゴリズム「FastSAC」と「FastTD3」を用いて、Unitree G1とBooster T1のヒューマノイドロボットの歩行制御を15分で学習できると発表した。単一のRTX 4090 GPUで数千の並列環境を利用する。

詳細

論文は、大規模並列シミュレーションによりロボットの強化学習トレーニング時間を日単位から分単位に短縮できると述べる。提案手法は、オフポリシーRLアルゴリズムを大規模に安定化させる設計選択と最小限の報酬関数を用いる。強いドメインランダム化(ランダム化されたダイナミクス、不整地、押し外乱)の下で、Unitree G1とBooster T1のエンドツーエンドの歩行制御学習を実証した。また、全身の人間動作追跡ポリシーの高速トレーニングも示す。コードと動画は公開されている。

Key Facts

研究チームはオフポリシーRLアルゴリズムFastSACとFastTD3を導入し、単一のRTX 4090 GPUで15分のトレーニングでヒューマノイド歩行ポリシーを学習できるとしている。出典一覧
提案手法はUnitree G1とBooster T1ロボットで実証された。出典一覧
論文は2025年12月1日にarXivで公開された。出典一覧
研究では強いドメインランダム化(ランダム化されたダイナミクス、不整地、押し外乱)の下でエンドツーエンドの学習を実証している。出典一覧
コードと動画はhttps://younggyo.me/fastsac-humanoidで公開されている。出典一覧

本紙の見方

今回の研究は、ヒューマノイドの歩行制御を強化学習で高速に学習する手法を示した点で新規性がある。従来のsim-to-real転移は時間がかかるとされていたが、オフポリシーアルゴリズムの大規模並列化により15分という短時間での学習を可能にした。これは、ロボットの歩行制御開発の反復サイクルを短縮する可能性を示唆する。 本紙の過去報道(2026年6月11日付『Unitree、中国ロボット産業の厳しい現実を予見か Reutersが分析』)では、Unitreeの動向が中国ロボット産業の厳しい現実を予見させると報じられた。今回の研究はUnitreeのハードウェアが研究プラットフォームとして活用されていることを示すが、産業化の厳しさとは直接関係しない。むしろ、研究コミュニティでのUnitreeの採用が進むことで、同社のハードウェアの評価が高まる可能性がある。 業界構造への含意としては、歩行制御の学習時間短縮は、ヒューマノイドの実用化に向けた開発コスト削減につながる可能性がある。特に、シミュレーションから実機への転移が高速化されれば、様々な環境での適応が容易になり、物流や介護などの分野での導入が進むかもしれない。 未確定の論点としては、提案手法が実際の製品開発にどの程度適用されるか、また学習時間の短縮が歩行の品質や安定性にどのように影響するかが挙げられる。さらに、他のハードウェアでの汎用性も確認が必要である。

なぜ重要か

ヒューマノイドの歩行制御学習が15分で可能になれば、開発サイクルが劇的に短縮され、ロボットの実用化が加速する可能性がある。また、Unitreeのハードウェアが研究で活用されることで、同社の技術力が評価される契機となる。