何が起きたか

2024年8月4日にarXivで公開された論文「RVI-SAC: Average Reward Off-Policy Deep Reinforcement Learning」において、平均報酬基準を採用したオフポリシー深層強化学習手法 RVI-SAC が提案された。この手法は、最先端のオフポリシー深層強化学習手法である Soft Actor-Critic (SAC) を平均報酬基準に拡張したものである。論文では、Gymnasium の MuJoCo タスク(移動タスクの一部)に適用し、既存手法と比較して競争力のある性能を示したと報告している。

詳細

多くの既存の深層強化学習手法は割引報酬基準を採用しているが、継続的タスクにおいては訓練目的と性能指標の間に乖離が生じる可能性があり、平均報酬基準が推奨される代替手段とされる。RVI-SAC は、この問題に対処するため、SAC を平均報酬基準に拡張したものである。 提案手法は、(1) RVI Q-learning に基づく Critic の更新、(2) 平均報酬ソフト方策改善定理によって導入された Actor の更新、(3) 終了を伴うタスクに平均報酬強化学習を適用できるようにする Reset Cost の自動調整、の3つの要素から構成される。

Key Facts

論文タイトルは「RVI-SAC: Average Reward Off-Policy Deep Reinforcement Learning」で、arXivに2024年8月4日に公開された。[1]
RVI-SAC は、平均報酬基準を用いたオフポリシー深層強化学習手法である。[1]
既存の深層強化学習手法の多くは割引報酬基準を採用しており、継続的タスクでは訓練目的と性能指標の乖離が生じる可能性があるとしている。[1]
RVI-SAC は、最先端のオフポリシー深層強化学習手法である Soft Actor-Critic (SAC) を平均報酬基準に拡張したものである。[1]
提案手法は、(1) RVI Q-learning に基づく Critic の更新、(2) 平均報酬ソフト方策改善定理による Actor の更新、(3) Reset Cost の自動調整、の3要素から構成される。[1]
Reset Cost の自動調整により、終了を伴うタスクに平均報酬強化学習を適用できるとしている。[1]
Gymnasium の MuJoCo タスク(移動タスクの一部)に適用し、既存手法と比較して競争力のある性能を示したと報告している。[1]

なぜ重要か

平均報酬基準は継続的タスクにおける訓練目的と性能指標の乖離を解消する可能性があり、深層強化学習の実用性を高める手法として注目される。RVI-SAC は SAC を拡張することで、既存の枠組みを保ちながら平均報酬基準を導入しており、今後の強化学習研究に影響を与える可能性がある。