Logan Mondal Bhamidipaty
収録論文 3本 ・ フィジカルAI/ロボット学習
報酬設計モデルベースRL強化学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 反復報酬設計の俯瞰的ベンチマーク報酬設計2026/10/3
LLMによる報酬関数の反復改善手法を統一環境で比較するベンチマークBIRDを提案し、単純な設計選択の組み合わせが既存手法より高性能であることを示した。
- RENEW: 選好から世界モデルの学習とモデル悪用の修復を目指してモデルベースRL2026/7/15
オフライン強化学習の世界モデルがデータの薄い領域で幻覚を起こす問題に対し、人間の選好を利用してモデルのダイナミクスを直接修正する手法を提案した。不確実性に基づく効率的な微調整により、サンプル効率を改善し、破滅的忘却を抑える。
- 不完全な世界モデルは悪用可能である強化学習2026/5/15
強化学習における世界モデルの悪用可能性を定義し、報酬ハッキングとの理論的関係を明らかにした論文。