Xianzhong Zhao
収録論文 2本 ・ フィジカルAI/ロボット学習
VLA/強化学習VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- WCM: 視覚・言語・行動強化学習のためのワールドクリティックモデルVLA/強化学習2026/7/1
ロボット操作のためのVLAモデルの強化学習後訓練において、観測履歴を扱うクリティックの表現が時間的ダイナミクスを捉えられない問題を解決するため、将来の潜在状態を予測しつつ価値を推定する軽量なWorld Critic Modelを提案した。
- SRPO: VLAモデルのための自己参照方策最適化VLA2025/11/1
VLAモデルの強化学習において、成功軌道を自己参照として失敗軌道に進捗報酬を付与し、報酬の疎さを解消する手法を提案。LIBEROで99.2%の成功率を達成。