何が起きたか

研究チームは、動物の運動制御から着想を得て、単一の歩行ポリシーで多様な四足ロボットを制御する手法を提案した。このポリシーは、可変数の自由度(12または16関節)、3つの異なる形態、2kgから200kgの質量範囲、18cmから100cmの立位高さに対応する。シミュレーションから実機への転送評価では、Unitree Go1とA1の両方で堅牢な性能を示し、A1の公称質量の125%に相当する15kgの負荷を追加しても動作した。

詳細

従来、四足ロボットの歩行ポリシー学習は特定のロボットの形態、質量、サイズに制約され、新しいロボットごとに学習プロセスを繰り返し、ハイパーパラメータや報酬関数の重みを再調整する必要があった。また、同じ自由度と形態を維持しながら異なるサイズのロボットに対応する単一ポリシーを訓練するには、複雑な学習フレームワークや質量・慣性・寸法のランダム化が必要で、訓練期間が長期化していた。 提案手法では、脊髄のCentral Pattern Generator(CPG)の表現を変調し、CPGの周波数と振幅を調整してリズミカルな出力(Rhythm Generation)を生成し、それをPattern Formation(PF)層にマッピングする。異なるロボット間で変化するのはPF層のみで、歩幅と歩行高さのスケーリングパラメータを調整する。

Key Facts

研究チームは、動物の運動制御に着想を得て、単一の歩行ポリシーで多様な四足ロボットを制御する手法を提案した。[1]
ポリシーは、可変数の自由度(12または16関節)、3つの異なる形態、2kgから200kgの質量範囲、18cmから100cmの立位高さに対応する。[1]
ポリシーは、脊髄のCentral Pattern Generator(CPG)の表現を変調し、周波数と振幅を調整してリズミカルな出力を生成し、Pattern Formation(PF)層にマッピングする。[1]
異なるロボット間で変化するのはPF層のみで、歩幅と歩行高さのスケーリングパラメータを調整する。[1]
シミュレーションから実機への転送評価では、Unitree Go1とA1の両方で堅牢な性能を示した。[1]
A1の公称質量の125%に相当する15kgの負荷を追加しても動作した。[1]

なぜ重要か

この研究は、四足ロボットの歩行ポリシー学習における従来の制約を克服し、単一のポリシーで多様なロボットを制御できる可能性を示す。これにより、新しいロボットごとに学習を繰り返す必要がなくなり、学習プロセスの効率化が期待される。