日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
sim2realarXiv:2608.22629

実2シミュレーション動力学推定と強化学習によるトルク制御ロボットのSim2Real転送の強化

Enhancing Sim2Real Transfer for Torque-Controlled Robots through Real2Sim Dynamics Estimation and Reinforcement Learning

シェア:XThreadsFacebookLINEはてブBluesky

トルク制御ロボットアームのシミュレーションから実機へのポリシー転送を改善するため、実機の軌跡データから動力学パラメータを同定し、遺伝的アルゴリズムとドメインランダム化を組み合わせたReal2Sim2Realパイプラインを提案した。7自由度のFranka Emika Pandaロボットで検証し、追従精度とロバスト性が向上した。

詳しい要約

1. どんなもの?

本研究は、トルク制御ロボットアームのSim2Real転送を改善するためのReal2Sim2Realパイプラインを提案している。具体的には、7-DOF Franka Emika Pandaロボットを用いて、軌道マッチング、遺伝的アルゴリズムによるパラメータ最適化、ドメインランダム化を組み合わせる。実機の関節軌道とシミュレーションの誤差を最小化することで、摩擦、慣性、重力補償パラメータを同定し、その較正されたダイナミクスを用いてTQCベースの強化学習エージェントをシミュレーションで訓練する。訓練されたポリシーはGazeboとMuJoCo環境で評価され、最終的に実機に展開される。

2. 先行研究と比べてどこがすごい?

従来のSim2Real転送は、特に低レベルのトルク制御において、モデルの不正確さが不安定や危険な挙動を引き起こすため困難であった。本研究は、Real2Simのダイナミクス推定を導入し、遺伝的アルゴリズムによるパラメータ最適化とドメインランダム化を組み合わせることで、物理モデルの精度を高め、ポリシーの堅牢性を向上させている点が新しい。これにより、トルク制御におけるシミュレーションと実機のギャップを効果的に縮小している。

3. 技術・手法の肝は?

手法の核は、Real2Sim2Realパイプラインである。まず、実機の関節軌道データを収集し、シミュレーションの軌道と比較して誤差を最小化するように摩擦、慣性、重力補償パラメータを遺伝的アルゴリズムで最適化する。次に、較正されたダイナミクスを用いてTQC(Truncated Quantile Critics)ベースの強化学習エージェントを訓練する。訓練時にはドメインランダム化を適用し、ポリシーの堅牢性を高める。最後に、訓練されたポリシーをGazeboとMuJoCoで評価し、実機に展開する。

4. どうやって有効だと検証した?

有効性の検証は、Franka Emika Pandaロボットを用いて行われた。較正前後のシミュレーションと実機での追従精度を比較し、パラメータ調整後に追従精度とポリシーの堅牢性が大幅に向上したことを示した。また、複数の目標到達タスクにおいて、シミュレーションから実機へのポリシー転送がスムーズに成功したことを報告している。

5. 議論はある?

要旨からは、議論の詳細は不明であるが、物理モデルの正確さがトルクベースの強化学習ポリシーの安定性と汎化に重要であると強調している。また、提案手法が特定のロボット(Franka Emika Panda)に限定されている可能性や、パラメータ同定の計算コスト、ドメインランダム化の範囲などが議論の対象となり得る。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、Real2Sim2Realパイプライン、遺伝的アルゴリズムによるパラメータ最適化、ドメインランダム化、TQCアルゴリズム、Sim2Real転送に関する研究が挙げられる。具体的には、TQCの元論文や、ドメインランダム化の代表的な研究(例えば、Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World)などが関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Davide Bargellini, Alex Pasquali, Andrea Govoni, Riccardo Zanella, Gianluca Palli

分類: cs.RO, eess.SY

原文アブストラクト

Transferring reinforcement learning policies from simulation to Real-World robots remains a major challenge, particularly when dealing with low-level torque control, where even small modelling inaccuracies can lead to unstable or unsafe behaviours. In this work, we propose a Real2Sim2Real pipeline that improves Sim2Real transfer for torque-controlled robotic arms by combining trajectory matching, parameter optimization via genetic algorithms, and domain randomization. Using the 7-DOF Franka Emika Panda robot, we first identify friction, inertia, and gravity compensation parameters by minimizing the error between real and simulated joint trajectories. These calibrated dynamics are then used to train a TQC-based reinforcement learning agent in simulation. The trained policy is evaluated in both Gazebo and MuJoCo environments, and finally deployed on the real robot. Our results demonstrate a significant improvement in tracking accuracy and policy robustness after parameter tuning, with smooth policy transfer from simulation to the Real-World across multiple target-reaching tasks. This work highlights the effectiveness of accurate physical modelling in enabling stable and generalizable torque-based reinforcement learning policies.

関連論文