Jakob N. Foerster
収録論文 1本 ・ フィジカルAI/ロボット学習
強化学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ベルマン方程式の逆転:Q値から世界モデルへ強化学習2026/6/19
価値ベースの強化学習エージェントが十分な報酬関数で訓練されると、暗黙的に環境の遷移モデルを符号化することを証明し、そのモデルを抽出するP学習を提案した。
世界のフィジカルAIを、日本語で。
収録論文 1本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
価値ベースの強化学習エージェントが十分な報酬関数で訓練されると、暗黙的に環境の遷移モデルを符号化することを証明し、そのモデルを抽出するP学習を提案した。