何が起きたか

arxiv.orgに2026年7月27日付で掲載された論文『Learning Reusable Hybrid Motion Priors for Humanoid Locomotion from Motion Imitation』において、研究チームは模倣学習による動作スキルを再利用可能なハイブリッド動作プリミティブ(HMP)に変換する3段階パイプラインを提案した。提案手法はUnitree G1実機での速度追従タスクで検証された。

詳細

提案手法は3段階で構成される。第1段階では、リターゲットされた人間のモーションキャプチャクリップを模倣する専門家ポリシーを訓練する。第2段階では、専門家を、 proprioceptive encoder、 residual vector-quantized (RVQ) codebook、 action decoder からなる凍結アーキテクチャに蒸留する。第3段階では、HMPを凍結したまま、離散コードブックエントリを選択することでタスクレベルのポリシーを訓練する。評価は、シミュレーションでの速度追従、ポイントゴールナビゲーション、転倒回復速度追従、および実機Unitree G1での速度追従ポリシーの展開によって行われた。蒸留プロセスは専門家の追従行動を保持し、HMPは再訓練なしで異なる下流の移動ポリシーのアクションインターフェースとして再利用できる。学習されたHMPは解釈可能なコードブック構造を示し、アクティブなRVQステージの数が利用可能な歩容パターンを調整する。さらに、回転トリックを用いたコードブック訓練は、標準的なstraight-through estimatorと比較して、潜在表現の組織化を改善し、下流の転倒を減少させることが示された。

Key Facts

論文『Learning Reusable Hybrid Motion Priors for Humanoid Locomotion from Motion Imitation』がarxiv.orgに2026年7月27日付で公開された。[1]
提案手法は、模倣学習によるスキルを再利用可能なハイブリッド動作プリミティブ(HMP)に変換する3段階パイプラインである。[1]
HMPは、proprioceptive encoder、residual vector-quantized (RVQ) codebook、action decoderからなる凍結アーキテクチャに蒸留される。[1]
速度追従ポリシーは実機Unitree G1で展開された。[1]
回転トリックを用いたコードブック訓練は、標準的なstraight-through estimatorと比較して、潜在表現の組織化を改善し、下流の転倒を減少させた。[1]

なぜ重要か

本手法は、ヒューマノイドの制御ソフトウェア開発において、タスクごとの再訓練を不要にする再利用可能な動作プリミティブを提案し、実機で検証した点で重要である。これにより、Unitree G1のようなヒューマノイドの実用化に向けたソフトウェア開発コストの削減が期待される。また、研究プラットフォームとしてのUnitreeの活用は、中国ロボット産業の技術発展の一端を示す。