Katherine Metcalf
収録論文 1本 ・ フィジカルAI/ロボット学習
強化学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 人間の選好に基づく報酬学習のための後知恵PRIOR強化学習2024/4/12
選好ベース強化学習において、世界モデルで状態の重要度を推定し、報酬を状態重要度に比例させる補助目的を導入することで、クレジット割り当て問題を改善し、歩行・操作タスクでの性能と報酬復元を向上させた。
世界のフィジカルAIを、日本語で。
収録論文 1本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
選好ベース強化学習において、世界モデルで状態の重要度を推定し、報酬を状態重要度に比例させる補助目的を導入することで、クレジット割り当て問題を改善し、歩行・操作タスクでの性能と報酬復元を向上させた。