何が起きたか

米国のロボット企業Figureは、ヒューマノイドロボットFigure 02向けに、強化学習(RL)で訓練したエンドツーエンドのニューラルネットワークによる歩行制御を導入したと発表した。同社によると、GPU加速された物理シミュレーション内で数千台のFigure 02を並列にシミュレートし、多様な物理パラメータやシナリオ(地形、アクチュエータの動特性変化、つまずき、滑り、押しなど)にさらして単一のニューラルネットワークポリシーを学習させる。シミュレーションと実機の間のドメインランダマイゼーションと高周波のトルクフィードバックを組み合わせることで、シミュレーションで訓練したポリシーは追加調整なしで実機に転送される(ゼロショット転送)としている。また、学習されたポリシーが人間の歩行スタイル(かかと着地、つま先離れ、脚の動きに同期した腕振りなど)を獲得するよう、学習フレームワークにその嗜好を注入するという。

Key Facts

Figureは、強化学習(RL)を用いて訓練したエンドツーエンドのニューラルネットワークによる歩行制御を導入したと発表した。[0]
Figure 02は、高忠実度の物理シミュレータで訓練され、数時間で数年分のデータをシミュレートする。[0]
シミュレーションでのドメインランダマイゼーションと実機での高周波トルクフィードバックを組み合わせることで、訓練されたポリシーは追加調整なしで実機にゼロショット転送される。[0]
シミュレーションでは数千台のFigure 02が並列にシミュレートされ、それぞれ異なる物理パラメータと多様なシナリオ(地形、アクチュエータの動特性変化、つまずき、滑り、押しなど)にさらされる。[0]
Figureは、人間らしい歩行スタイル(かかと着地、つま先離れ、脚の動きに同期した腕振りなど)を学習フレームワークに注入するとしている。[0]

なぜ重要か

ヒューマノイドロボットの歩行制御は、実用化に向けた重要な課題の一つ。Figureは強化学習とシミュレーションを活用することで、開発サイクルの短縮と実世界での堅牢な性能を両立させようとしている。同社の発表は、ヒューマノイドの移動技術における強化学習の有効性を示す事例となる。