何が起きたか
研究チームは、人間の動作追跡(GMT)を基盤とし、残差学習を用いて物体操作を組み込む2段階フレームワーク「ResMimic」を提案した。このフレームワークは、大規模な人間動作データで訓練されたGMTポリシーをベースとし、その出力を残差ポリシーで洗練することで、移動と物体インタラクションを改善する。評価はシミュレーションと実機のUnitree G1ヒューマノイドで行われ、強力なベースラインと比較してタスク成功率、学習効率、堅牢性で大幅な向上が確認された。
詳細
ResMimicは、一般的な動作追跡(GMT)が持つ精度と物体認識の欠如を克服するために設計された。GMTポリシーはタスクに依存しないベースとして機能し、人間らしい全身動作を生成する。その後、効率的かつ正確な残差ポリシーがGMT出力を洗練し、移動の改善と物体インタラクションの組み込みを実現する。 訓練を効率化するために、3つの工夫が導入された。(i) 点群ベースの物体追跡報酬は最適化を滑らかにし、(ii) 接触報酬はヒューマノイドの身体と物体の正確なインタラクションを促進し、(iii) カリキュラムベースの仮想物体コントローラは初期訓練を安定させる。これらの要素により、ResMimicはシミュレーションと実機の両方で高い性能を発揮した。
Key Facts
| ResMimicは2段階の残差学習フレームワークであり、人間の動作データからヒューマノイドの全身ロコ操作を実現する。 | [1] |
| ResMimicは、大規模な人間動作のみのデータで訓練されたGMTポリシーをタスク非依存のベースとして使用する。 | [1] |
| 残差ポリシーはGMT出力を洗練し、移動の改善と物体インタラクションを組み込む。 | [1] |
| ResMimicは、点群ベースの物体追跡報酬、接触報酬、カリキュラムベースの仮想物体コントローラを設計に含む。 | [1] |
| ResMimicはシミュレーションと実機のUnitree G1ヒューマノイドで評価された。 | [1] |
| 結果は、強力なベースラインと比較してタスク成功率、学習効率、堅牢性で大幅な向上を示した。 | [1] |
| ビデオはhttps://resmimic.github.io/で公開されている。 | [1] |
なぜ重要か
ResMimicは、ヒューマノイドが日常のサービスや倉庫作業で必要とされる精密な物体操作を伴う全身動作を実現するための新しい手法を提供する。GMTの限界を克服し、実機での有効性を示したことで、ヒューマノイドの実用化に向けた重要な一歩となる。