何が起きたか

中国のロボット企業Unitreeは、四足ロボットGo2を用いた二足歩行によるロコマニピュレーション手法を発表した。この研究は、2025年7月27日にarXivにプレプリントとして公開された論文「Bipedalism for Quadrupedal Robots: Versatile Loco-Manipulation through Risk-Adaptive Reinforcement Learning」で報告されている。提案手法は、後脚で二足歩行しながら前脚を解放し、環境との多様なインタラクションを可能にする。実機ではUnitree Go2を用いて、カート押し、障害物探索、ペイロード輸送などのタスクを実証した。

詳細

従来の四足ロボットのロコマニピュレーションでは、脚をマニピュレータとして使うと移動が損なわれたり、アームを取り付けるとシステムが複雑化する問題があった。本研究では、四足ロボットに二足歩行を導入することで、前脚を環境とのインタラクションに解放するアプローチを提案している。 提案するリスク適応型の分布強化学習フレームワークは、後脚で歩行する四足ロボット向けに設計され、本質的に不安定なタスクにおいて、最悪ケースの保守性と最適性能のバランスを取る。トレーニング中、適応的なリスク選好は、推定リターン分布の変動係数で測定されるリターンの不確実性に基づいて動的に調整される。 シミュレーションでの広範な実験により、ベースライン手法と比較して優れた性能を示した。実機展開では、Unitree Go2ロボットでポリシーの汎用性を実証し、カート押し、障害物探索、ペイロード輸送などのタスクを実行できることを示した。また、困難なダイナミクスや外部外乱に対する堅牢性も示された。

Key Facts

Unitreeは四足ロボットGo2を用いた二足歩行によるロコマニピュレーション手法を発表した。[1]
論文は2025年7月27日にarXivで公開された。[1]
提案手法はリスク適応型の分布強化学習フレームワークを用いる。[1]
フレームワークは後脚で歩行する四足ロボット向けに設計されている。[1]
リスク選好はリターン分布の変動係数に基づいて動的に調整される。[1]
シミュレーション実験でベースライン手法より優れた性能を示した。[1]
実機ではUnitree Go2でカート押し、障害物探索、ペイロード輸送などのタスクを実証した。[1]
実機展開では困難なダイナミクスや外部外乱に対する堅牢性も示された。[1]

なぜ重要か

この研究は、四足ロボットの脚をマニピュレータとして活用する新たな方法を提案し、アームを追加せずに多様なタスクを可能にする。リスク適応型の強化学習は、不安定な二足歩行タスクにおける安全性と性能のトレードオフを扱う手法として注目される。