何が起きたか

Figureは2025年3月25日、ヒューマノイドロボットFigure 02の歩行制御に強化学習(RL)を導入したと発表した。同社はエンドツーエンドのニューラルネットワークをGPU高速化シミュレーションで訓練し、数千台の仮想ロボットを並列実行して数年分のデータを数時間で生成。シミュレーションと実機のギャップはドメインランダマイゼーションとkHzレートのトルクフィードバック制御で埋め、ポリシーは追加調整なしで実機にゼロショット転送される。発表では10台のFigure 02が同一のRLニューラルネットワークで動作する様子が示され、同社は「このプロセスが近い将来、数千台のFigureロボットにスケールする」と期待を示した。

詳細

Figureの歩行制御は、高忠実度物理シミュレータ上で強化学習を用いて訓練される。シミュレーションでは数千台のFigure 02が並列実行され、各ロボットに異なる物理パラメータが設定される。訓練では、人間の歩行参照軌跡を模倣する報酬を設定し、かかと着地、つま先離地、腕振りなどの人間らしい歩容を学習する。追加の報酬項で速度追従、消費電力、外乱や地形変化へのロバスト性を最適化する。実機転送では、ドメインランダマイゼーションにより物理特性をランダム化し、kHzレートの閉ループトルク制御でアクチュエータモデルの誤差を補償する。これにより、ロボット間の個体差や表面摩擦の変化、外部からの押しに対してもロバストな歩行が実現する。Figureは「この技術がフリート全体に追加のエンジニアリング作業なしでスケールし、商業運用を支援する」としている。

Key Facts

Figureは2025年3月25日、Figure 02の歩行制御に強化学習を導入したと発表した。[1]
訓練はGPU高速化物理シミュレーションで行われ、数千台のFigure 02が並列実行され、数年分のデータを数時間で生成する。[1]
シミュレーションと実機のギャップは、ドメインランダマイゼーションとkHzレートのトルクフィードバック制御で埋められ、ポリシーはゼロショットで実機に転送される。[1]
10台のFigure 02が同一のRLニューラルネットワークで動作し、追加調整なしでロバストな歩行を実現した。[1]
Figureは、このプロセスが近い将来、数千台のFigureロボットにスケールすると期待を示した。[1]

本紙の見方

今回の発表は、ヒューマノイドの歩行制御を強化学習でエンドツーエンドに学習し、実機へゼロショット転送するという点で、従来のモデルベース制御や手動調整に依存したアプローチからの明確な転換を示す。Figureは2024年1月にBMWとの提携を発表しており、今回の歩行制御の進展は、自動車工場での実用化に向けた基盤技術の強化と位置づけられる。本紙が2026年8月13日に報じたアステリアのFigure AIへの出資(100万米ドル)は、このような技術開発の潜在性を評価したものとみられる。 業界構造への含意として、強化学習による歩行制御の確立は、ヒューマノイドの量産・展開において重要な意味を持つ。Figureは「フリート全体に追加のエンジニアリング作業なしでスケールする」と述べており、これは個体ごとの調整コストを排除し、多数のロボットを同時運用する際の経済性を高める。競合のAgility RoboticsやApptronikも同様の歩行制御技術を開発しているが、Figureはゼロショット転送とフリートスケールを明確に打ち出しており、この点で差別化を図る。 一方、未確定の論点として、今回の歩行制御が実際の商業運用でどの程度の耐久性と信頼性を示すかは不明である。Figureは「近い将来、数千台にスケールする」と期待を示すが、具体的な台数や導入時期は明らかにしていない。また、歩行以外の操作(腕や手の制御)への応用や、強化学習の報酬設計が人間らしい動作にどの程度寄与するかも、今後の検証が待たれる。

なぜ重要か

Figureの強化学習による歩行制御は、ヒューマノイドの実用化に向けた重要なマイルストーンであり、フリート全体でのスケーラビリティを示す点で業界に影響を与える。自動車メーカーとの提携や投資家の関心を背景に、この技術が商業展開の加速につながるかが焦点となる。