Jiexin Wang
収録論文 2本 ・ フィジカルAI/ロボット学習
強化学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 正則化された報酬・罰則強化学習強化学習2026/6/1
報酬追求と罰則回避のポリシーを相互に事前分布として連携させるフレームワークKCPRを提案し、その深層実装klDMPがグリッドワールドとロボットナビゲーションで安全性と学習安定性を向上させることを示した。
- 最大エントロピーを用いた報酬・罰則強化学習強化学習2024/5/1
報酬と罰則を同時に扱う強化学習に方策エントロピー最大化を統合したsoftDMPを提案し、従来のmax/min演算子を滑らかにしてサンプル効率と頑健性を向上させた。