何が起きたか

2026年4月17日にarxiv.orgで公開された論文『Flexible Empowerment at Reasoning with Extended Best-of-N Sampling』が、強化学習(RL)における探索と活用のジレンマ(EED)を柔軟に調整する手法を提案した。提案手法は、BoNサンプリングを探索促進項であるエンパワーメントに適用し、Tsallis統計に基づく拡張を行う。

詳細

論文は、従来の内発的動機付けRLではエンパワーメントを報酬ボーナスとして加えるため、ポリシー学習に遅延が生じ、探索の強調度を調整しにくいと指摘する。一方、基盤モデルの推論時微調整で用いられるBoNサンプリングは、明示的な学習なしに修正ポリシーを暗黙的に獲得できる。本研究では、このBoNサンプリングをエンパワーメントに適用し、さらにTsallis統計で拡張した新たなBoNサンプリング法を提案する。トイプロブレムでEEDのバランス調整能力を検証し、複雑な移動タスクでRL性能が向上することを示した。

Key Facts

論文は2026年4月17日にarxiv.orgで公開された。[1]
提案手法はBoNサンプリングをエンパワーメントに適用し、Tsallis統計に基づく拡張を行う。[1]
従来の内発的動機付けRLではエンパワーメントを報酬ボーナスとして加えるため、ポリシー学習に遅延が生じる。[1]
トイプロブレムでEEDのバランス調整能力を検証し、複雑な移動タスクでRL性能が向上することを示した。[1]

なぜ重要か

この研究は、強化学習の探索と活用のバランスを、学習プロセスを変えずに推論時に調整できる可能性を示す。基盤モデルの推論時計算手法をRLに応用する流れを後押しし、実ロボットや複雑な制御タスクでの学習効率向上につながる可能性がある。ただし、実用化にはさらなる検証が必要だ。