何が起きたか
arXivは2026年9月20日、論文「STRIDER: Stepping-Enabled Multi-Gait Hierarchical 3D Loco-Manipulation Framework for Humanoid Robots」を公開した。論文は、ヒューマノイドのロコマニピュレーションにおける3つの課題、すなわち個々の足位置を精密に制御しにくいこと、足場追従モジュールを全身操作に統合しにくいこと、異種技能を共有表現に落とし込みにくいことを扱う。STRIDERは、terrain-awareな3D stepping、AMPベースの自然歩行、Cartesian上半身制御を統合する構成である。
詳細
stepping expertは、stance-foot frameで実行可能な足場を選び、clearance-awareなswing trajectoryを生成する。歩行とsteppingの専門家を1つの実行可能なstudent policyにまとめるため、論文はteacher-conditioned latent alignmentを加えたLatent Distillation Proximal Policy Optimization(LD-PPO)を提案している。 LD-PPOは、on-policy reinforcement learning、DAgger-based action reconstruction、latent alignmentを同時に最適化する。シミュレーションと実機評価では、TianGong Omni humanoid上で、LD-PPOがvanilla distillation-PPOよりfoothold-tracking accuracyとposture-tracking accuracyで上回ったとしている。実機では、STRIDERがaccurate foothold and end-effector trackingを伴うmulti-gait loco-manipulationを実現したとしている。
Key Facts
| arXivは2026年9月20日に「STRIDER: Stepping-Enabled Multi-Gait Hierarchical 3D Loco-Manipulation Framework for Humanoid Robots」を公開した。 | [1] |
| STRIDERは、terrain-aware 3D stepping、AMP-based natural walking、Cartesian upper-body controlを統合する。 | [1] |
| stepping expertはstance-foot frameでfeasible footholdsを選び、clearance-aware swing trajectoriesを生成する。 | [1] |
| LD-PPOは、teacher-conditioned latent alignmentを加えたdistillation algorithmである。 | [1] |
| TianGong Omni humanoidでの評価では、LD-PPOがvanilla distillation-PPOをfoothold-trackingとposture-trackingの精度で上回った。 | [1] |
本紙の見方
STRIDERの新しさは、ヒューマノイド制御を「歩行」と「上半身操作」に分けるだけでなく、足場選択そのものを階層化し、さらにそれを単一のstudent policyへ蒸留している点にある。論文が問題視しているのは、連続速度コマンドだけでは個別の足位置を精密に扱いにくいこと、専用の足場追従モジュールは全身操作と統合しづらいこと、そして通常の模倣蒸留では技能間の共通表現を明示的に作りにくいことだ。ここでの焦点は、動作生成の精度だけでなく、異なる技能をどの表現空間で束ねるかに移っている。 構造として見ると、STRIDERは入力側でterrain-awareな3D steppingを用いて足場候補を選び、中間でAMP-based natural walkingを通し、出力側でCartesian upper-body controlを組み合わせる。つまり、地形認識から足運び、上半身の操作までを一つの実行系に連結している。この連結を支えるのがLD-PPOであり、on-policy reinforcement learning、DAgger-based action reconstruction、latent alignmentを同時に回す設計は、単なる模倣ではなく、教師の動きを保ちながら異種モード間の表現を寄せる狙いがあると読める。 したがって本件は、歩行器用の制御と操作器用の制御をどう接合するか、というヒューマノイド研究の古典的課題に対する実装提案として位置づく。もっとも、論文要旨だけでは、学習に使った環境の多様性、評価タスクの範囲、実機での成功率や失敗条件は分からない。TianGong Omni humanoidでの結果が他の機体や未見地形にどこまで一般化するか、またLD-PPOが計算量や学習時間をどの程度増やすかが次の確認点になる。
なぜ重要か
論文は、ヒューマノイドで「足場を選ぶ」「体を運ぶ」「上半身を操作する」を一体化する方法を示しており、実機のTianGong Omni humanoidで精度比較まで行っている。研究段階ではあるが、足運びと把持・操作を別系統にせず統合したい開発者にとって、制御アーキテクチャの選択肢を具体化する材料になる。