何が起きたか
arxiv.orgに2025年11月30日付で掲載された論文『Partially Equivariant Reinforcement Learning in Symmetry-Breaking Environments』において、対称性が部分的に破れた環境向けの強化学習フレームワークPI-MDP(Partially group-Invariant MDP)と、それを用いたアルゴリズムPE-DQN(離散制御用)およびPE-SAC(連続制御用)が提案された。著者らは、Grid-World、 locomotion、 manipulationの各ベンチマークで既存手法を有意に上回る性能を達成したと報告している。
詳細
論文は、実世界の環境では完全な群不変MDPは稀であり、ダイナミクスや報酬設計などにより対称性が局所的に破られることが多いと指摘する。従来の群不変ベルマン更新を適用すると、局所的な対称性破れによる誤差が状態行動空間全体に伝播し、価値推定の精度が低下する。PI-MDPは、対称性が成り立つ領域では群不変ベルマン更新を、破れている領域では標準のベルマン更新を選択的に適用することで、この問題を緩和する。これにより、等変性の利点を保ちつつ、サンプル効率と汎化性能を向上させる。提案アルゴリズムPE-DQNとPE-SACは、それぞれ離散制御と連続制御向けに設計され、実験でその有効性が示された。
Key Facts
| 論文『Partially Equivariant Reinforcement Learning in Symmetry-Breaking Environments』がarxiv.orgに2025年11月30日付で掲載された。 | [1] |
| 提案されたPI-MDPは、対称性が成り立つ領域でのみ群不変ベルマン更新を適用し、局所的な対称性破れによる誤差伝播を抑える。 | [1] |
| 提案アルゴリズムはPE-DQN(離散制御用)とPE-SAC(連続制御用)であり、Grid-World、locomotion、manipulationのベンチマークで既存手法を上回る性能を示した。 | [1] |
なぜ重要か
本手法は、強化学習における対称性利用の実用性を高めるものであり、実世界のタスクで性能向上が期待できる。特に、ロボット工学や自動運転など、環境の対称性が完全には保証されない分野での応用が進む可能性がある。