Chenyang Cao
収録論文 5本 ・ フィジカルAI/ロボット学習
ロボット清掃強化学習/拡散ポリシー強化学習安全RLオフライン強化学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Push-Wiper: 多様な汚れと表面に対応するセグメント化押し出し軌道による汎用ロボット清掃ロボット清掃2026/8/1
粘性の高い汚れを押し出し軌道で集約する清掃フレームワークPush-Wiperを提案し、拡散ポリシーで適応的な動作を生成して、多様な汚れや曲面にゼロショットで一般化できることを示した。
- QPILOTS: フローポリシーのための効率的なテスト時Qステアリング強化学習/拡散ポリシー2026/6/11
フローマッチングや拡散ポリシーを強化学習で最適化する際、推論時にノイズ除去プロセスをQ値の勾配で操縦する手法QPILOTSを提案し、オフラインからオンラインへのRLベンチマークで高い成功率を達成した。
- 残差報酬モデルによる選好ベース強化学習強化学習2025/7/1
選好ベース強化学習において、事前知識の報酬と学習した報酬を足し合わせる残差報酬モデルを提案し、収束速度と性能を改善した。
- FOSP: ワールドモデルによるオフライン安全方策のファインチューニング安全RL2024/7/1
オフラインで学習した安全方策を、到達可能性ガイダンス付きのモデルベースRLでオンライン微調整し、未知の安全制約シナリオへの汎化を改善する手法を提案。
- 安全性が重要なタスクのための復帰方策を用いたオフライン目標条件付き強化学習オフライン強化学習2024/3/1
オフライン目標条件付き強化学習において、安全制約を守りつつ目標到達を達成するRecovery-based Supervised Learning (RbSL)を提案し、ロボット把持環境のベンチマークと実機Pandaで有効性を示した。