何が起きたか
arXivに2022年11月18日付で掲載された論文「Building a Subspace of Policies for Scalable Continual Learning」において、著者らは継続学習のための新手法「Continual Subspace of Policies (CSP)」を発表した。CSPは強化学習エージェントが一連のタスクを学習する際に、政策の部分空間を段階的に構築する手法であり、タスク数に対して部分線形に成長する。実験では、移動タスクのBraxと操作タスクのContinual Worldの2つの領域で、複数の一般的なベースラインを上回る性能を示した。
詳細
既存の継続学習手法は、固定サイズのモデルが多様な行動の学習に苦労するか、タスク数に応じてモデルサイズが増大しスケーラビリティに問題があった。CSPはタスク系列に応じて適応的に成長する設計を採用し、エージェントのサイズと性能のバランスを改善することを目指している。 CSPは政策の部分空間の高い表現力を活用し、多くの異なるタスクで良好な性能を発揮しつつ、タスク数に対して部分線形に成長する。また、忘却を起こさず、新しいタスクへの正の転移を示すとされる。
Key Facts
| 論文タイトルは「Building a Subspace of Policies for Scalable Continual Learning」で、arXivに2022年11月18日付で掲載された。 | [1] |
| 新手法は「Continual Subspace of Policies (CSP)」と呼ばれる。 | [1] |
| CSPは強化学習エージェントが一連のタスクを学習する際に、政策の部分空間を段階的に構築する。 | [1] |
| CSPの部分空間は高い表現力を持ち、多くの異なるタスクで良好な性能を発揮する。 | [1] |
| CSPはタスク数に対して部分線形に成長する。 | [1] |
| CSPは忘却を起こさず、新しいタスクへの正の転移を示す。 | [1] |
| CSPはBrax(移動)とContinual World(操作)の2つの領域で、複数の一般的なベースラインを上回った。 | [1] |
なぜ重要か
CSPは、固定サイズモデルと成長型モデルのトレードオフを解消する可能性を持つ。タスク数に応じて適応的に成長しながら忘却を防ぎ、正の転移を実現する点で、継続学習のスケーラビリティ向上に寄与すると考えられる。