日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
脚式マニピュレーションarXiv:2610.01612

ReCo: 応答一貫性のある脚式マニピュレーションのためのポリシー認識型MPC

ReCo: Response-Consistent Locomotion with Policy-Aware MPC for Legged Manipulation

シェア:XThreadsFacebookLINEはてブBluesky

脚式ロボットの歩行中に腕で連続的なマニピュレーションを行うため、強化学習ポリシーの応答を一貫化し、その閉ループ応答モデルを組み込んだMPCでベースと腕を協調制御する手法を提案。

詳しい要約

1. どんなもの?

- 脚式ロボットによる連続的なマニピュレーション(歩行しながらのエンドエフェクタ追従)を実現するフレームワーク「ReCo」を提案。 - 強化学習(RL)によるロコモーションとモデル予測制御(MPC)を組み合わせ、ベースとアームの協調を図る。 - 応答一貫性のあるロコモーションとポリシー認識型MPCを結合する点が特徴。

2. 先行研究と比べてどこがすごい?

- 従来のRL+MPCでは、MPCが予測可能なベース運動のみ補償し、学習ポリシーの指令応答が歩容フェーズ・接触・ペイロードで変動する問題があった。 - ReCoは応答整形によりランダム化されたダイナミクス下でも一貫した再現性のある指令応答を学習し、MPCが閉ループ応答モデルを同定してロコモーション指令とアーム運動を共同計画できる。 - シミュレーションベンチマークで位置RMSEを28.7%、姿勢RMSEを27.4%低減(各指標の最良ベースライン比)。

3. 技術・手法の肝は?

- 応答整形(Response shaping):ランダム化されたダイナミクス下で指令に対する一貫性・再現性を高めるようポリシーを訓練。 - 同定された閉ループ応答モデル:ポリシーの応答をモデル化し、MPCがロコモーション指令とアーム運動を共同で計画可能にする。 - ポリシー認識型MPC:学習ポリシーの特性を考慮したMPCにより、ベースとアームの協調を実現。

4. どうやって有効だと検証した?

- シミュレーションベンチマークで評価し、位置および姿勢のRMSEを最良ベースラインと比較してそれぞれ28.7%、27.4%低減。 - 実世界実験でオンボードの連続的な脚式マニピュレーションを実証し、ベースとアームの協調運動を確認。

5. 議論はある?

- 要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究は明示されていない。関連手法として、RLとMPCを組み合わせた脚式ロコモーション(例:Learning-based MPC for legged robots)や、脚式マニピュレーション(例:Whole-body MPC for legged manipulation)が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Kuankuan Sima, Yichao Gao, Chenxi Gu, Kefan Zhao, Lin Zhao

分類: cs.RO

原文アブストラクト

Continuous legged manipulation requires accurate end-effector tracking while the base keeps walking. Combining reinforcement learning (RL) with model predictive control (MPC) suits this task: the learned policy provides robust locomotion, while MPC coordinates the base and arm to compensate for tracking errors. However, MPC can compensate only for base motion that it can predict, and a learned policy's command response varies with gait phase, contact, and payload. We present ReCo, a framework that couples response-consistent locomotion with policy-aware MPC for legged manipulation. Response shaping trains the policy to respond to commands consistently and repeatably across randomized dynamics. An identified closed-loop response model then lets MPC jointly plan locomotion commands and arm motion. On the simulation benchmark, ReCo reduces position and orientation root-mean-square error (RMSE) by 28.7% and 27.4% relative to the best baseline for each metric. Real-world experiments demonstrate onboard continuous legged manipulation with coordinated base and arm motion.

関連論文

PR本紙発行元 EmplifAI