日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
強化学習arXiv:2609.08642

SUN: 強化学習における新規性への到達

SUN: Reaching for Novelty in Reinforcement Learning

シェア:XThreadsFacebookLINEはてブBluesky

強化学習の探索において、新規性と到達可能性を同時に考慮した目標選択フレームワークSUNを提案し、到達不能な状態を含む環境で既存手法を上回る性能を示した。

詳しい要約

1. どんなもの?

本論文は、強化学習における探索問題に取り組み、新規性(novelty)と到達可能性(reachability)を同時に考慮した目標選択フレームワークを提案する。具体的には、後続価値関数(successor value functions)から導出される指標SUccessor-to-Novelty (SUN)を導入し、オフポリシーRLアルゴリズムに組み込むことで、新規かつ到達可能な目標を選択する。

2. 先行研究と比べてどこがすごい?

従来のgoal-conditioned RL戦略は、新規性と到達可能性のシグナルを手動でトレードオフしたり、順番に適用したり、一方を無視することが多かった。SUNはこれらを明示的に統合し、理論的保証を提供する点が優れている。また、到達不能な目標を拒否できることや、count-based bonusを極限で回復するなどの理論的特性を持つ。

3. 技術・手法の肝は?

SUNは後続価値関数から導出され、新規性と到達可能性を同時に評価する。さらに、適応的な目標選択戦略と、古典的手法のオーバーヘッドを避けるための軽量なpseudocountを提案する。理論的には、SUNがcount-based bonusを極限で回復し、短期間のヒット確率を制限し、到達不能な目標を証明可能に拒否することを示す。

4. どうやって有効だと検証した?

標準および新規環境(到達不能または到達困難な状態、不可逆遷移、障害物、迷路、非有界空間を含む)での徹底的なベンチマークを通じて、SUNが最先端手法を一貫して上回ることを実証した。

5. 議論はある?

要旨からは、SUNの理論的保証と実証結果が示されているが、計算コストや実世界への適用可能性、他のRLアルゴリズムとの統合の詳細などについては不明である。また、pseudocountの精度と軽量性のトレードオフについての議論も要旨からは読み取れない。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、goal-conditioned RL戦略やcount-based exploration手法が挙げられる。具体的には、後続価値関数を用いた手法や、新規性探索に関する既存研究を読むことが推奨される。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Wenyan Yang, Arsenii Mustafin, Dominik Baumann, Joni Pajarinen, Simone Parisi

分類: cs.LG, cs.AI, cs.RO

原文アブストラクト

Exploration in reinforcement learning (RL) remains a fundamental challenge. Recent goal-conditioned RL strategies (which select goals to encourage broader state coverage) have shown promising results, but none scores a goal by novelty and reachability jointly: the two signals are traded off by hand, applied in sequence, or one is neglected outright. In this paper, we introduce a reachability-aware goal-selection framework that explicitly integrates these two aspects, and that can be seamlessly incorporated into any off-policy RL algorithm. To this aim, we propose SUccessor-to-Novelty (SUN), an indicator derived from successor value functions to identify goals that are both novel and reachable. We prove that SUN recovers count-based bonuses in the limit, bounds short-horizon hitting probabilities, and provably rejects unreachable goals. We further present an adaptive goal-selection strategy that leverages these properties, and an accurate yet lightweight pseudocount to avoid the overhead of classic methods. We back up all our claims with thorough benchmarks: SUN consistently outperforms state-of-the-art methods in standard and novel environments with unreachable or hard-to-reach states, irreversible transitions, obstacles, mazes, and unbounded spaces.

関連論文