日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
報酬学習arXiv:2609.04066v1

部分空間推論による選好からの効率的な能動報酬学習

Subspace Inference Enables Efficient Active Reward Learning from Preferences

シェア:XThreadsFacebookLINEはてブBluesky

選好に基づく報酬学習において、拡張カルマンフィルタを低次元部分空間で適用し、報酬モデルの不確実性を効率的に追跡する手法を提案した。

詳しい要約

1. どんなもの?

本論文は、人間の選好から報酬モデルを学習するRLHF(Reinforcement Learning from Human Feedback)における能動学習のサンプル効率を改善する手法「PreferenceEKF」を提案している。PreferenceEKFは、選好学習を逐次ベイズフィルタリング問題として捉え、拡張カルマンフィルタ(EKF)を低次元パラメータ部分空間上で適用することで、大規模ニューラルネットワーク報酬モデルの不確実性を効率的に追跡する。これにより、能動学習の獲得関数を計算するためのパラメータサンプリングをスケーラブルに行うことを可能にする。

2. 先行研究と比べてどこがすごい?

従来のRLHFでは、報酬モデルの不確実性を定量化することが難しく、特に大規模ニューラルネットワークでは全パラメータ空間での事後推論が計算的に高価であるため、能動学習の効果的なクエリ生成が困難だった。PreferenceEKFは、低次元部分空間での逐次推論により、計算コストを抑えつつ不確実性を追跡できる点が新しい。また、既存のベイズ深層学習手法と比較して、サンプル効率、実行時間、スケーラビリティ、キャリブレーションの点で優れていることを実験で示している。

3. 技術・手法の肝は?

手法の核心は、報酬モデルのパラメータを低次元部分空間に射影し、その部分空間上で拡張カルマンフィルタ(EKF)を用いて逐次ベイズ更新を行う点にある。これにより、全パラメータ空間での高価な事後推論を回避し、新しい選好クエリが到着するたびに報酬モデルの事後分布を更新する。さらに、部分空間上でパラメータをサンプリングすることで、能動学習の獲得関数(例えば、不確実性に基づくクエリ選択)を効率的に計算する。

4. どうやって有効だと検証した?

D4RLおよびV-D4RLベンチマークを用いて実験を行い、PreferenceEKFのサンプル効率、実行時間、スケーラビリティ、キャリブレーションを他のベイズ深層学習手法と比較した。また、学習した報酬モデルを用いたオフライン強化学習のポリシー性能も評価し、競争力のある結果を得た。

5. 議論はある?

要旨からは、PreferenceEKFの限界や潜在的な問題についての議論は不明である。ただし、低次元部分空間の選択が性能に影響する可能性や、EKFの線形化誤差が蓄積する可能性などが考えられるが、要旨には明記されていない。

6. 次に読むべき論文は?

要旨で参照されている関連研究としては、ベイズ深層学習手法(例えば、Deep Ensembles、MC Dropout、Variational Inferenceなど)や、能動学習を用いた選好ベースの報酬学習に関する研究が挙げられる。また、RLHFの基盤となる人間の選好からの学習に関する論文(例えば、Christiano et al.のPreference-based RL)も関連する。具体的な論文名は要旨にないため、同分野の定番として「Preference-based Reinforcement Learning」や「Bayesian Deep Learning for Uncertainty Estimation」を挙げる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Yutai Zhou, Erdem Bıyık

分類: cs.LG, cs.AI, cs.RO

原文アブストラクト

Reinforcement learning from human feedback (RLHF) has emerged as a powerful yet sample-inefficient approach for learning reward models from human preferences, making active learning a critical component in synthesizing informative preference queries. However, effective uncertainty quantification required for active learning remains a key challenge for large neural network reward models. In this paper, we introduce PreferenceEKF, a sample-efficient approach that tracks reward model uncertainty by framing active preference learning as a sequential Bayesian filtering problem. Instead of relying on computationally prohibitive posterior inference over the full neural network parameter space, our method performs sequential inference via an extended Kalman filter within a low-dimensional parameter subspace, continuously updating the reward model posterior as new preference queries arrive. Our approach enables scalable sampling of neural network parameters to efficiently compute acquisition functions for active reward learning. Experiments on the D4RL and V-D4RL benchmarks demonstrate that our approach achieves better sample efficiency, runtime, scalability, and calibration compared to other Bayesian deep learning approaches, and the learned reward models lead to competitive offline reinforcement learning policy performance. This highlights the potential of scalable Bayesian methods for preference-based reward modeling in RLHF. Our code is available at https://github.com/yutaizhou/bnn_pref.

関連論文