Yigit Korkmaz
収録論文 6本 ・ フィジカルAI/ロボット学習
報酬学習報酬モデリング連続制御/強化学習模倣学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 理由付き選好フィードバックからの因果的に頑健な報酬学習報酬学習2026/3/1
選好ベースの報酬学習において、自然言語の理由を活用して因果的な手がかりを提供し、スプリアスな特徴への依存を減らすフレームワークReCouPLeを提案した。
- Robometer:軌道比較による汎用ロボット報酬モデルのスケーリング報酬モデリング2026/3/1
軌道内の進捗監督と軌道間の選好監督を組み合わせた報酬モデルを提案し、100万軌道のデータセットで学習することで、汎用性の高い報酬関数を実現した。
- 構造的最大化可能なQ関数によるアクターフリー連続制御連続制御/強化学習2025/10/1
連続行動空間での制御において、アクターを別途学習せずにQ関数の構造的最大化を利用する純粋な価値ベース強化学習フレームワークを提案し、標準的なシミュレーションタスクで従来手法と同等以上の性能とサンプル効率を達成した。
- ロボットが人間より上手くなる:制約付き実演者からの学習模倣学習2025/10/1
制約のある実演から状態のみの報酬を推定し、より短く効率的な軌道を探索することで、模倣学習を超える性能を実現した。
- MILE: モデルベース介入学習模倣学習2025/2/1
専門家の介入データと非介入時のフィードバックを活用し、モデルベースで介入を定式化することで、わずかな介入からロボットの模倣学習を効率的に行う手法を提案。
- CyberDemo: Augmenting Simulated Human Demonstration for Real-World Dexterous Manipulation2024/2/1