Jiaxin Fan
収録論文 1本 ・ フィジカルAI/ロボット学習
オフライン強化学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- オフライン強化学習のためのポリシー抽出の分離オフライン強化学習2026/8/21
オフライン強化学習では、アクターと批評家を同時に訓練する従来の手法が、固定データによる過大評価やOOD行動の問題を引き起こす。本論文では、アクターを行動分布のモデリングに限定し、推論時に批評家が候補行動を再ランク付けする「分離ポリシー抽出」パラダイムを提案し、性能向上を実証した。