Raymond Tsao
収録論文 2本 ・ フィジカルAI/ロボット学習
強化学習模倣学習/RLファインチューニング
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 成功訪問マッチングによるプロセス報酬学習でRLを効率化強化学習2026/6/1
スパースな報酬を、成功・失敗エピソードを判別する識別器を使って密なプロセス報酬に変換し、ロボット操作タスクのRL微調整を高速化する手法を提案した。
- 事後行動クローニング:効率的なRLファインチューニングのためのBC方策の事前学習模倣学習/RLファインチューニング2025/12/1
模倣学習で事前学習した方策がRLファインチューニングの初期値として不十分な場合があることを理論的に示し、デモンストレータ行動の事後分布をモデル化するPostBCを提案して効率的なファインチューニングを可能にした。