Haoyuan Hu
Institute of Automation, Chinese Academy of Sciences
収録論文 2本 ・ フィジカルAI/ロボット学習
VLA選好ベース強化学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- BICPO-VLA: 行動識別による継続選好最適化を用いた滑らかな非同期視覚言語行動制御VLA2026/8/14
ロボットの動作生成中に生じる要求から引き継ぎまでのギャップを、行動意図の識別、Haar部分空間による動作チャンク分解、参照相対Flow-DPOによる適応の3段階で解消する手法を提案した。
- SENIOR: 選好ベース強化学習における効率的なクエリ選択と選好誘導探索選好ベース強化学習2025/6/1
人間の選好から報酬を学習する強化学習において、比較しやすい動作区間を選ぶクエリ選択法と選好に基づく探索手法を組み合わせ、フィードバック効率と方策学習を改善した。