Longbo Huang
収録論文 2本 ・ フィジカルAI/ロボット学習
報酬設計モデルベース強化学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MLREF: 大規模言語モデルによる強化学習の報酬設計における効率的なモジュール再利用報酬設計2026/8/19
報酬関数をモジュール単位で進化させるフレームワークMLREFを提案し、再利用可能なモジュールプールを導入して報酬設計の安定性と性能を向上させた。
- 再パラメータ化フローポリシー最適化モデルベース強化学習2026/2/3
フローポリシーをモデルベース強化学習に組み込み、生成過程とダイナミクスをまとめて誤差逆伝播することで、高いサンプル効率と安定性を実現した手法を提案。