Xinyi Ni
収録論文 1本 ・ フィジカルAI/ロボット学習
RLHF
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 汚染された人間フィードバックからの頑健なリスク感応強化学習RLHF2026/9/30
人間の比較フィードバックが敵対的に反転される状況で、CVaRに基づくリスク感応型RLHF手法を提案し、不確実性重み付き報酬推定と楽観的計画により後悔を抑える。
世界のフィジカルAIを、日本語で。
収録論文 1本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
人間の比較フィードバックが敵対的に反転される状況で、CVaRに基づくリスク感応型RLHF手法を提案し、不確実性重み付き報酬推定と楽観的計画により後悔を抑える。