日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
継続学習arXiv:2608.21899

CIDER: 身体化強化学習のための継続的対話蒸留

CIDER: Continual Interactive Distillation for Embodied Reinforcement Learning

シェア:XThreadsFacebookLINEはてブBluesky

実世界の継続的強化学習において、過去のポリシーを教師として凍結し、蒸留による保持とタスク学習を交互に行うことで、破滅的忘却を防ぎながら新しいスキルを獲得するフレームワークを提案した。

詳しい要約

1. どんなもの?

CIDERは、実世界のロボット操作タスクを連続的に学習するための強化学習フレームワークである。人間の介入による実世界RLを継続学習に拡張し、新しいスキルを獲得しながら過去の行動を保持する。6つの実世界の家庭用・産業用操作タスクで評価され、各タスクを10〜20分で学習しつつ、過去のタスクの成功率を維持する。

2. 先行研究と比べてどこがすごい?

既存の実世界継続学習手法は過去の行動を明示的に制約せず、深刻な破滅的忘却を引き起こす。CIDERは、過去のポリシーを教師として凍結し、蒸留ベースの保持を導入することで、この問題を解決する。また、勾配ルーティングにより新タスク獲得と過去行動保持の勾配を分離する点が新しい。

3. 技術・手法の肝は?

手法の核心は、(1) 新しいタスクを学習する前に累積された過去のポリシーを教師として凍結し、蒸留による保持をタスク学習と交互に行うこと、(2) 勾配ルーティングにより新タスク獲得用の勾配と過去行動保持用の勾配を分離すること。これにより、安定性と可塑性のトレードオフを制御する。

4. どうやって有効だと検証した?

単一の共有アクターを用いて、6つの実世界の家庭用・産業用操作タスクのシーケンスで評価した。Interactive Distillationは、過去のタスクの成功率を高く維持しつつ、各新タスクを10〜20分で獲得した。一方、すべてのベースラインは少なくとも1つの過去タスクを忘却した。さらに、アブレーション研究により、実世界の継続RLにおける安定性と可塑性のトレードオフを左右する主要な設計選択を明らかにした。

5. 議論はある?

要旨からは、議論の詳細は不明。ただし、安定性と可塑性のトレードオフに関する設計選択の重要性が示唆されており、実世界の継続学習における課題(例えば、タスク間の干渉やリソース制約)が議論される可能性がある。

6. 次に読むべき論文は?

要旨で参照されている関連手法は明示されていないが、実世界の継続学習や蒸留ベースの手法(例えば、Learning without ForgettingやProgressive Neural Networks)が関連する。また、実世界RLの人間参加型手法(例えば、Interactive RL)も関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Houlin Li, Minghui Xu, Guo Xu, Xuan Du, Xiaohan Yan, Chun Wang, Yuxiang Yan, Shukai Yang, Yongcheng Liu, Wei Shan, Maoqing Yao

分類: cs.RO

原文アブストラクト

Human-in-the-loop real-world reinforcement learning enables rapid acquisition of effective robotic manipulation policies for individual tasks, often within tens of minutes. Yet it remains unclear how to extend this paradigm to continual learning, where a single policy must acquire new skills without losing previously learned behaviors. Existing real-world continual learning methods do not explicitly constrain prior behaviors, leading to severe catastrophic forgetting. We introduce Continual Interactive Distillation for Embodied Reinforcement Learning (CIDER), a continual reinforcement learning framework that freezes the accumulated historical policy as a teacher before learning each new task and interleaves task learning with distillation-based retention. We further introduce gradient routing to separate the gradients used for acquiring new tasks from those used for preserving prior behaviors. We evaluate our method with a single shared actor on six real-world household and industrial manipulation tasks. Interactive Distillation maintains high measured success on previously learned tasks across our six-task real-robot sequence while acquiring each new task in 10 to 20 minutes, whereas every baseline forgets at least one previous task. Additional ablations reveal the key design choices that govern the tradeoff between stability and plasticity in real-world continual reinforcement learning.

関連論文