Naoki Shitanda
収録論文 1本 ・ フィジカルAI/ロボット学習
強化学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 大規模強化学習におけるアンサンブル方策勾配法のポリシー多様性の再考強化学習2026/3/1
アンサンブル方策勾配法において、ポリシー間の多様性をKL制約で調整するCoupled Policy Optimizationを提案し、探索効率と最終性能を向上させた。
世界のフィジカルAIを、日本語で。
収録論文 1本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
アンサンブル方策勾配法において、ポリシー間の多様性をKL制約で調整するCoupled Policy Optimizationを提案し、探索効率と最終性能を向上させた。