日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
強化学習/器用操作/sim2realarXiv:2608.19182

ADEPT: 事前学習と強化学習による事後学習で器用さを加速する

ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning

シェア:XThreadsFacebookLINEはてブBluesky

高自由度ロボットの器用な操作を、事前学習と事後学習を組み合わせた強化学習フレームワークで実現し、シミュレーションから実機への転移を可能にした。

詳しい要約

1. どんなもの?

ADEPTは、高自由度(DoF)の多指ロボットにおいて、生の視触覚知覚から長期的なタスクを直接解決できるシミュレーションから実世界への転移可能な器用さを学習するための大規模強化学習(RL)フレームワークである。汎用の物体再配置タスクで事前学習し、その事前学習済みの行動を事前分布として下流タスクのポリシーを事後学習する。

2. 先行研究と比べてどこがすごい?

従来のRLは多指ロボットで新しい行動をゼロから発見するのが難しく、下流タスクごとに同じスキルを再学習する必要があった。ADEPTは事前学習により共通のスキルを獲得し、下流タスクへの転移を効率化する点で優れている。また、単純なRLファインチューニングでは事前学習の能力が劣化する問題に対し、安定した事後学習レシピを提案している。

3. 技術・手法の肝は?

手法の肝は、事前学習と事後学習の組み合わせにある。事前学習では汎用の物体再配置タスクでポリシーを学習し、下流タスクではその事前分布を活用する。事後学習では、行動クローニング蒸留、批評家のウォームアップ、保守的なオン方策更新を組み合わせて、事前学習の能力を維持しながら新しいタスクを学習する。さらに、RLポリシーとロボットの間を仲介する関節空間のGeometric Fabricを導入し、運動学的な器用さを安全に活用する。

4. どうやって有効だと検証した?

23 DoFのKuka-Allegro(2台のRGBカメラ)と29 DoFのFlexiv-Sharpa(2台のRGBカメラと5つの視覚ベース触覚センサ)の2つの実機で検証した。事後学習した教師ポリシーを蒸留した知覚学生ポリシーが、シミュレーションから実世界へのゼロショット転移に成功し、困難な初期状態から長期的なタスクを人間レベルの速度で解決できることを示した。

5. 議論はある?

要旨からは、事前学習の汎用性や、異なるロボット間での転移可能性、タスクの多様性に関する議論は不明。また、Geometric Fabricの詳細や、触覚センサの活用方法についての議論も要旨には含まれていない。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、sim-to-real転移のためのRL、事前学習とファインチューニングの手法、多指ロボットの器用な操作に関する研究が挙げられる。具体的には、Dexterous ManipulationのためのRL、Domain Randomization、Behavior Cloning、Critic Warm-upなどの手法が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff, Karl Van Wyk, Ankur Handa

分類: cs.RO, cs.AI

原文アブストラクト

We introduce Accelerating Dexterity via Pre-Training (ADEPT), a large-scale reinforcement learning (RL) framework for learning sim-to-real transferable dexterity across high degree-of-freedom (DoF) robot embodiments that can solve long-horizon tasks directly from raw visuo-tactile perception. ADEPT pretrains a dexterous policy on a generic object reposing task, then post-trains downstream policies with this pretrained behavior as a prior. ADEPT enables learning new behaviors that are otherwise difficult to discover from scratch on multi-fingered robots and avoids learning the same set of skills over again for every new downstream task. The pretrained policy zero-shots the reposing phase of downstream tasks, but naïve RL fine-tuning rapidly degrades this capability during transfer. We address this with a stable post-training recipe combining behavior-cloning distillation, critic warm-up, and conservative on-policy updates. To safely exploit the full kinematic dexterity, we introduce a joint-space Geometric Fabric that mediates between the RL policy and the robot. We distill post-trained teachers into perceptive students that zero-shot sim-to-real transfer on two embodiments: a 23 DoF Kuka-Allegro with two RGB cameras, and a 29 DoF Flexiv-Sharpa with two RGB cameras and five vision-based tactile sensors, and can solve long-horizon tasks from challenging initial states with dexterity at human-level speed.