何が起きたか

2023年7月19日にarXivで公開された論文「STRAPPER: Preference-based Reinforcement Learning via Self-training Augmentation and Peer Regularization」において、選好に基づく強化学習(PbRL)の新手法が提案された。この手法は、人間による二値選好ラベルを用いて複雑な報酬関数を学習するPbRLの課題、特にラベル付けの人的コストを軽減することを目的とする。提案手法は、自己学習とピア正則化を導入し、類似したセグメントペアに対する選好が逆転する「類似性の罠」問題に対処する。実験では、移動やロボット操作の行動学習において有効性が示された。

詳細

PbRLは、人間の二値選好から複雑な報酬関数を学習することを約束するが、セグメントペアへの選好ラベル付けに多大な人的労力が必要であり、大規模応用の妨げとなっている。近年のアプローチでは、未ラベルのセグメントを再利用し、セグメントの分布を暗黙的に解明することで人的労力を軽減しようとしてきた。さらに、半教師あり学習の性能向上のため、整合性正則化が検討されている。しかし、一般的な分類タスクとは異なり、PbRLには「類似性の罠」と呼ばれる特有の現象が存在する。直感的には、人間は類似したセグメントペアに対して正反対の選好を持ち得るが、この類似性が整合性正則化を失敗させる可能性がある。類似性の罠の存在により、整合性正則化はセグメントペア間のモデル予測の整合性を不適切に強化し、拡張分布が元の分布と一致しないため、報酬学習の信頼性を低下させる。この問題を克服するため、提案手法では自己学習とピア正則化を導入し、報酬モデルが情報のないラベルを記憶することを罰し、確信度の高い予測を得る。実験では、様々な半教師あり代替手法とピア正則化を用いて、移動やロボット操作の行動学習をうまく学習できることが実証された。

Key Facts

論文は2023年7月19日にarXivで公開された(arXiv:2307.09692v1)。[1]
提案手法は「STRAPPER」と呼ばれる。[1]
STRAPPERは自己学習とピア正則化を組み合わせた手法である。[1]
PbRLは人間の二値選好から複雑な報酬関数を学習する。[1]
PbRLではセグメントペアへの選好ラベル付けに多大な人的労力が必要である。[1]
類似性の罠は、類似したセグメントペアに対して人間が正反対の選好を持ち得る現象である。[1]
類似性の罠により整合性正則化が失敗する可能性がある。[1]
ピア正則化は報酬モデルが情報のないラベルを記憶することを罰する。[1]
実験では移動やロボット操作の行動学習で有効性が示された。[1]

なぜ重要か

この研究は、PbRLにおける人的労力の削減と学習性能の向上を両立する可能性を示すものであり、ロボット操作や移動行動の学習など、実世界の応用に向けた強化学習の発展に寄与すると考えられる。