何が起きたか

2023年6月11日付でarXivに掲載された論文「Policy Regularization with Dataset Constraint for Offline Reinforcement Learning」において、著者らはオフライン強化学習の新手法PRDCを提案した。PRDCは、固定データセットから最良の政策を学習する問題を扱い、政策更新時にデータセット全体から最近傍の状態行動ペアを探索し、そのサンプルの行動で政策を制限する。これにより、データセットに存在しない行動を選択できるようにしつつ、分布外行動に対する保守性を保つとしている。実験では、移動およびナビゲーションタスク群において既存手法を上回る性能を達成したと報告している。コードはGitHubで公開されている。

詳細

オフライン強化学習では、固定データセットから政策を学習する際、分布外の行動を避けるために既存手法は行動政策の分布やサポートに政策を制約する。しかし、これらの制約は過度に保守的であり、特に行動政策が準最適な場合に学習政策の性能を制限する。PRDCは、特定の状態における政策更新時に、データセット全体から最近傍の状態行動サンプルを探索し、そのサンプルの行動で政策を制限する。これにより、データセット内の適切な行動を政策に導きつつ、データセットに存在しない行動も選択可能にする。これはより緩やかな制約でありながら、分布外行動に対する十分な保守性を維持する。理論的分析と実証により、PRDCはオフライン強化学習の根本的な課題である価値の過大評価問題を、有界な性能ギャップで緩和できることを示した。

Key Facts

論文タイトルは「Policy Regularization with Dataset Constraint for Offline Reinforcement Learning」で、arXivに2023年6月11日付で公開された。[1]
PRDCは政策更新時にデータセット全体から最近傍の状態行動ペアを探索し、その行動で政策を制限する。[1]
既存の分布制約やサポート制約は過度に保守的で、行動政策が準最適な場合に性能を制限する。[1]
PRDCはデータセットに存在しない行動を選択できるようにする、より緩やかな制約である。[1]
PRDCは分布外行動に対する十分な保守性を維持する。[1]
理論的分析と実証により、PRDCは価値の過大評価問題を有界な性能ギャップで緩和する。[1]
移動およびナビゲーションタスク群において、PRDCは既存手法と比較して最先端の性能を達成した。[1]
コードはhttps://github.com/LAMDA-RL/PRDCで公開されている。[1]

なぜ重要か

オフライン強化学習は実データから安全に政策を学習する手法として注目されているが、分布外行動による価値の過大評価が課題である。PRDCはデータセット制約による新しい正則化手法を提案し、既存手法の保守性の問題を緩和することで、より高性能な政策学習を可能にする可能性がある。