Michael Gimelfarb
収録論文 6本 ・ フィジカルAI/ロボット学習
オフポリシー評価
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- STITCH-OPE: ガイド付き拡散による軌道スティッチングを用いたオフポリシー評価オフポリシー評価2025/5/1
行動データで事前学習した拡散モデルを目標方策のスコアでガイドし、部分軌道を繋ぎ合わせることで、高次元・長期間のオフポリシー評価を低分散で行う手法を提案した。
- Constraint-Generation Policy Optimization (CGPO): Nonlinear Programming for Policy Optimization in Mixed Discrete-Continuous MDPs2024/1/1
- Risk-Aware Transfer in Reinforcement Learning using Successor Features2021/5/1
- {\epsilon}-BMC: A Bayesian Ensemble Approach to Epsilon-Greedy Exploration in Model-Free Reinforcement Learning2020/7/1
- Bayesian Experience Reuse for Learning from Multiple Demonstrators2020/6/1
- Contextual Policy Transfer in Reinforcement Learning Domains via Deep Mixtures-of-Experts2020/3/1