何が起きたか

arXiv に2025年6月6日付で公開された論文(ID: 2506.05968v2)において、オンライン強化学習の連続行動空間向けアクタークリティック法に対し、ベルマン最適性作用素からベルマン作用素へ徐々に遷移するアニーリング手法が提案された。同手法は TD3 および SAC と組み合わせられ、複数の locomotion・manipulation タスクで既存手法を有意に上回る性能を示したと報告されている。コードは https://github.com/motokiomura/annealed-q-learning で公開されている。

詳細

連続行動空間の強化学習では、アクタークリティック法が広く用いられる。離散行動向けのアルゴリズムがベルマン最適性作用素を用いて最適価値関数をモデル化するのに対し、連続行動向けのアルゴリズムはベルマン作用素を用いて現在のポリシーに対するQ値をモデル化するのが一般的である。このため、連続行動向けアルゴリズムはポリシー更新のみに依存し、サンプル効率が低くなることが多い。 本研究では、アクタークリティックの枠組みにベルマン最適性作用素を組み込む効果を検証した。単純な環境での実験では、最適価値のモデル化が学習を加速する一方で過大評価バイアスを生じることが示された。そこで、ベルマン最適性作用素からベルマン作用素へ段階的に遷移するアニーリング手法を提案し、学習の加速とバイアスの軽減を両立させた。提案手法は TD3 および SAC と組み合わせた場合、様々な locomotion・manipulation タスクで既存手法を大幅に上回り、最適性関連のハイパーパラメータに対するロバスト性も向上したとしている。

Key Facts

論文は arXiv に2025年6月6日付で公開された(ID: 2506.05968v2)。[1]
連続行動空間ではアクタークリティック法が広く用いられる。[1]
連続行動向けアルゴリズムはベルマン作用素を用いて現在のポリシーに対するQ値をモデル化する。[1]
単純な環境での実験では、最適価値のモデル化が学習を加速するが過大評価バイアスを生じる。[1]
提案手法はベルマン最適性作用素からベルマン作用素へ段階的に遷移するアニーリング手法。[1]
提案手法は TD3 および SAC と組み合わせて評価された。[1]
様々な locomotion・manipulation タスクで既存手法を大幅に上回る性能を示した。[1]
最適性関連のハイパーパラメータに対するロバスト性も向上した。[1]
コードは https://github.com/motokiomura/annealed-q-learning で公開されている。[1]

なぜ重要か

連続行動空間の強化学習におけるサンプル効率の課題に対し、ベルマン最適性作用素の活用とバイアス軽減を両立する新しいアプローチを提示している。既存のアクタークリティック法と組み合わせて性能向上を示した点で、実用的な強化学習アルゴリズムの改善に寄与する可能性がある。