何が起きたか
2023年6月7日にarXivで公開された論文「Rewarded soups: towards Pareto-optimal alignment by interpolating weights fine-tuned on diverse rewards」は、複数の報酬関数で個別に微調整したモデルの重みを線形補間する手法を提案した。この手法は、単一の報酬に依存せず、多様な選好空間全体でのパレート最適な汎化を目指す。実験では、テキスト生成(要約、Q&A、アシスタント、レビュー)、画像(キャプション生成、テキストからの画像生成、視覚的グラウンディング、VQA)、制御(移動)タスクで有効性を示した。
詳細
論文は、基盤モデルが大規模な教師なしデータで事前学習され、ラベル付きデータで微調整される過程に着目する。人間のフィードバックからの強化学習(RLHF)は、ネットワークを意図した用途にさらに合わせるが、プロキシ報酬の不完全さが訓練を妨げ、最適以下の結果を招く可能性がある。現実のタスクや人間の意見の多様性がこの問題を悪化させる。 提案手法は、多様な報酬の異質性を受け入れ、複数のポリシー戦略を採用する。具体的には、各プロキシ報酬に対して独立にネットワークを特殊化し、その重みを線形補間する。この成功は、共有の事前学習初期化から多様な報酬で微調整された重みが線形に接続されているという経験的観察に基づく。
Key Facts
| 論文は2023年6月7日にarXivで公開された(arXiv:2306.04488v2)。 | [1] |
| 提案手法は「rewarded soups」と呼ばれ、複数の報酬で微調整した重みを線形補間する。 | [1] |
| 手法はパレート最適な汎化を目指し、単一の事前報酬に依存しない。 | [1] |
| 実験はテキスト生成(要約、Q&A、ヘルプフルアシスタント、レビュー)で行われた。 | [1] |
| 実験は画像タスク(画像キャプション生成、テキストからの画像生成、視覚的グラウンディング、VQA)で行われた。 | [1] |
| 実験は制御タスク(移動)で行われた。 | [1] |
| 重みは共有の事前学習初期化から多様な報酬で微調整された場合に線形に接続される。 | [1] |
なぜ重要か
この研究は、RLHFにおけるプロキシ報酬の不完全性に対処する新しい方法を提案する。多様な報酬を扱うことで、より堅牢でパレート最適なモデルアライメントが可能になり、実世界の多様な選好に対応できる可能性がある。