何が起きたか
2025年11月12日にarXivに公開された論文(ID: 2511.08922v1)において、オフライン強化学習向けの新手法「DIVO(DIffusion policies with Value-conditional Optimization)」が提案された。DIVOは拡散モデルを用いて、データセット内の分布に沿った高品質な状態-行動サンプルを生成しつつ、効率的なポリシー改善を実現する。具体的には、オフラインデータセット内の行動のアドバンテージ値を利用した二値重み付け機構を導入し、拡散モデルの訓練をガイドする。これにより、データセットの分布への精密な整合を図りながら、高アドバンテージ行動の境界を選択的に拡張する。ポリシー改善時には、拡散モデルから高リターン潜在性のある行動を動的にフィルタリングし、学習ポリシーをより良い性能へ導く。
詳細
オフライン強化学習では、分布外(OOD)行動による価値の過大評価がポリシー性能を著しく制限する問題がある。近年、拡散モデルはその強力な分布マッチング能力を活用し、行動ポリシー制約を通じて保守性を強化する手法が注目されている。しかし、既存手法は低品質データセット内の冗長な行動に対して無差別な正則化を適用することが多く、過度な保守性を招き、拡散モデリングの表現力と効率性のバランスを損なうという課題があった。DIVOはこの問題に対処するため、アドバンテージ値に基づく二値重み付け機構を導入し、データセットの分布への整合を精密化しつつ、高アドバンテージ行動の探索範囲を広げる。これにより、オフラインRLにおける保守性と探索性の重要なバランスを達成する。DIVOはD4RLベンチマークで評価され、最先端のベースラインと比較された。実験結果によると、DIVOはlocomotionタスクで平均リターンを大幅に向上させ、スパース報酬が課題となるAntMaze領域でも既存手法を上回る性能を示した。
Key Facts
| DIVOはオフライン強化学習向けの新手法であり、拡散モデルを用いて高品質な状態-行動サンプルを生成する。 | [1] |
| DIVOは二値重み付け機構を導入し、オフラインデータセット内の行動のアドバンテージ値を利用して拡散モデルの訓練をガイドする。 | [1] |
| DIVOはポリシー改善時に高リターン潜在性のある行動を動的にフィルタリングする。 | [1] |
| DIVOはD4RLベンチマークで評価され、locomotionタスクで平均リターンを向上させた。 | [1] |
| DIVOはAntMaze領域で既存手法を上回る性能を示した。 | [1] |
| 論文は2025年11月12日にarXivで公開された(ID: 2511.08922v1)。 | [1] |
なぜ重要か
DIVOはオフライン強化学習における価値の過大評価問題に対し、拡散モデルとアドバンテージ値の活用により保守性と探索性のバランスを改善する新しいアプローチを提供する。D4RLベンチマークでの性能向上は、実世界の応用が難しいオフラインRLの実用性を高める可能性を示唆している。