何が起きたか
2026年7月15日にarXivに公開された論文「RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences」において、研究チームはオフライン強化学習の世界モデルにおけるモデル搾取を修復する新手法RENEWを提案した。RENEWは、人間の好みを利用してダイナミクスの幻覚を直接修復する「Dynamics Learning from Human Feedback (DLHF)」を導入し、Bradley-Terry選好損失を用いて軌道の対数尤度を学習する。評価はJumanjiおよび古典的制御環境で行われ、ナイーブなDLHFと比較してサンプル効率が向上し、破滅的忘却が抑制され、事前学習済み世界モデルでの搾取が低減したと報告されている。
詳細
世界モデルはオフライン強化学習で広く使われ、サンプル効率を改善し、固定データセットを超えた経験を生成する。しかし、データカバレッジが薄い領域ではモデル搾取に対して脆弱である。従来の対策は、高価で安全でないか利用不可能な専門家デモの追加収集、または不確実な領域を避ける保守的アルゴリズムに依存しており、一般化を制限していた。 RENEWは、人間が直感的な物理に基づいて明らかなダイナミクスの幻覚を容易に見抜けることを利用し、想像上のロールアウトに対する人間の好みを用いて搾取を直接修復する。DLHFは、学習されたダイナミクスモデルの下での軌道対数尤度に対するBradley-Terry選好損失として形式化される。しかし、ナイーブなDLHFはサンプル非効率であるため、RENEWは認識的不確実性を用いて、モデルが最も搾取されやすい場所に微調整を集中させる。 実験では、ナイーブなDLHFが過大な選好予算を必要とする一方、RENEWはサンプル効率を改善し、破滅的忘却を制限し、事前学習済み世界モデルでの搾取を低減することで、フレームワークを実用的にした。結果は、選好が世界モデルのダイナミクスを直接監督できるという初期の証拠を提供し、オフラインモデルベースRLにおける搾取への新しいアプローチを示している。
Key Facts
| 論文は2026年7月15日にarXivで公開された(arXiv:2607.14180v1)。 | [1] |
| RENEWは、人間の好みを用いて世界モデルのモデル搾取を修復する手法である。 | [1] |
| DLHF(Dynamics Learning from Human Feedback)は、Bradley-Terry選好損失を軌道の対数尤度に適用する。 | [1] |
| RENEWは認識的不確実性を用いて、モデルが最も搾取されやすい場所に微調整を集中させる。 | [1] |
| 評価はJumanjiおよび古典的制御環境で行われた。 | [1] |
| ナイーブなDLHFは過大な選好予算を必要とする。 | [1] |
| RENEWはサンプル効率を改善し、破滅的忘却を制限し、事前学習済み世界モデルでの搾取を低減した。 | [1] |
| 従来の対策は専門家デモの追加収集または保守的アルゴリズムに依存していた。 | [1] |
なぜ重要か
この研究は、オフライン強化学習における世界モデルのモデル搾取問題に対して、人間の選好を直接利用する新しいアプローチを提案している。従来の保守的アルゴリズムが一般化を制限するのに対し、RENEWは選好による直接修復でサンプル効率を改善し、実用性を示した。これは、選好が世界モデルのダイナミクスを監督できるという初期の証拠を提供し、今後のオフラインモデルベースRLの研究に影響を与える可能性がある。