何が起きたか
arXivは2026-09-25付の論文「Generate, Track, Improve: Perceptive Multi-Skill Humanoid Locomotion with RL-Fine-Tuned Motion Generators」を公開した。論文は、Unitree G1人型ロボット向けに、深度画像から全身軌道を計画する運動生成器と、それを追従する制御ポリシーからなる2層の移動制御アーキテクチャを提案している。著者らは、成功した地形横断が最大25ポイント、技能選択が最大80ポイント改善したとしている。
詳細
論文では、(1) raw depth imagesから全身軌道を計画する perceptive flow matching motion generator と、(2) control-guided RLで学習した perceptive tracking policy を組み合わせた2層構成を取る。両方のポリシーは、動的に最適化した人間データから作成した terrain consistent motion clips のライブラリで学習している。 中核は、運動生成器を改善するための off-policy RL fine tuning loop である。structured search method を用いて advantage weighted regression のためのデータを集める設計で、論文はこれが on-policy residual fine tuning より sample efficient だと述べる。raw depth images を使うため odometry や height maps は不要とし、2台のカメラでより遠方の地形を認識し、指示速度にかかわらず速度を調整して地形を通過できるとしている。
Key Facts
| arXiv掲載日 2026-09-25 の論文「Generate, Track, Improve: Perceptive Multi-Skill Humanoid Locomotion with RL-Fine-Tuned Motion Generators」 | [1] |
| 対象は Unitree G1 人型ロボットである | [1] |
| 2層構成として、raw depth images から軌道を計画する motion generator と tracking policy を組み合わせる | [1] |
| 成功した地形横断は最大25ポイント改善し、技能選択は最大80ポイント改善した | [1] |
| 論文は、屋外環境で walk, run, stand, jump on and off of boxes, traverse stairs を1組の policy pair で実行できるとしている | [1] |
本紙の見方
今回の焦点は、単一の歩行器具や単純な追従制御ではなく、深度画像に基づく運動生成と追従制御を分けた2層構成にある。論文が強調するのは、odometry や height maps を使わず raw depth images で環境を捉え、さらに off-policy の RL 微調整で運動生成器自体を改善する点である。つまり、ロボットの脚運動を「認識→計画→追従」の一本線で処理するのではなく、環境認識を前提にした軌道生成と、生成された動作をなぞる制御を切り分けている。Unitree G1に対して、歩行・走行・停止・箱の昇降・階段移動までを同じポリシー対で扱えるとするため、狙いは汎用動作の範囲拡大にあると読める。 本紙の関連記事である 王兴興氏、ロボットの核心課題は「数ミリの作業誤差」と指摘 は、実世界では精度不足が汎用化の壁になるという見方を示していた。今回の論文は、その課題を歩行制御の側で具体化したものと言える。とりわけ、未見地形での成功率が最大25ポイント、技能選択が最大80ポイント改善したという数字は、単に見た目の動作を増やすのではなく、地形と技能の組み合わせに対する頑健性を上げることが中心課題であることを示す。ただし、これらは論文内の評価指標であり、実機の長時間運用や異なる環境で同じ改善幅が再現されるかは別問題である。 業界構造で見ると、この手法はロボット本体の機構だけでなく、入力としての深度センサー、学習用の人間モーションデータ、そして RL 微調整用のデータ収集・探索手法を束ねる。言い換えれば、ロボットの移動性能はハードウェア単独ではなく、センサー入力と学習パイプラインの設計に強く依存する局面にある。Unitree G1向けと明記されていることからも、同じ制御手法が他機種にそのまま移るとは限らない。今後の確認点は、実機での再現条件、2台のカメラ構成の汎用性、学習に使った motion clips の規模、そして屋外での稼働時間や失敗条件である。
なぜ重要か
論文が示したのは、Unitree G1の移動を深度画像ベースで制御し、階段や箱の昇降まで1組のポリシー対で扱うという具体的な設計である。これは、ロボットの移動性能が機体そのものだけでなく、センサー入力と学習法の組み合わせで決まることを示すため、制御ソフトと認識系をどう束ねるかが実装上の焦点になる。
日本への影響
日本企業や研究機関にとっては、移動制御を機械設計だけでなく深度画像・学習データ・RL微調整まで含む一体設計として考える必要性を示す。特に、屋外での階段・箱の昇降を同一ポリシーで扱うという構成は、センサーと学習パイプラインの整備が前提になる。