Qining Zhang
University of Michigan
収録論文 1本 ・ フィジカルAI/ロボット学習
強化学習/PbRL
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SP3O: 報酬モデリングなしでセグメント選好から強化学習する手法強化学習/PbRL2026/8/3
報酬モデルを使わずに、セグメント単位の選好フィードバックから方策を直接学習する新しい勾配ベースのPbRLアルゴリズムSP3Oを提案した。理論的解析とロボット制御・LLM微調整での実験で、特に長期的タスクでの性能向上を示した。