Yuyang Liu
収録論文 9本 ・ フィジカルAI/ロボット学習
評価指標エージェント/経験進化歩行ロボット評価模倣学習強化学習/報酬設計マニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PRM-as-a-Judge 1.5: ロボットプロセス評価のためのツールキット評価指標2026/8/14
ロボットの動作動画から詳細な進捗曲線を生成し、失敗側の進捗や回復能力、成功側の実行品質など複数の細かい指標を導出する評価ツールキットを提案した。
- LabEvolver: 訓練不要の経験進化による安全で接地されたウェットラボエージェントエージェント/経験進化2026/7/1
実行経験からエピソード記憶を獲得し、安全検証を伴う適応的知覚・計画を行う訓練不要のフレームワークを提案。pH調整タスクで時間と安全介入を大幅削減し、ALFWorldでも成功率を向上させた。
- HORIZON: 回復可能性に基づく物理領域スケーリングのカリキュラム歩行2026/6/1
ロボットポリシーの堅牢性を高めるため、物理領域を段階的に拡張するカリキュラム学習手法HORIZONを提案。回復可能性を制約として、四足歩行タスクで有効性を示した。
- PRM-as-a-Judge:ロボットの細粒度監査のための高密度評価パラダイムロボット評価2026/3/1
ロボットの実行品質をバイナリ成功率ではなく、プロセス報酬モデル(PRM)を用いて軌道ビデオから密に評価する新しいパラダイムを提案し、OPD指標体系と診断ベンチマークRoboPulseで検証した。
- 後知恵オンライン模倣によるフローから方策への変換模倣学習2025/12/1
高レベルプランナが生成した2D点フローを、オンライン試行錯誤と後知恵目標再ラベリングで目標条件付き模倣方策に接地し、操作タスクの性能を2倍以上に改善する手法を提案。
- TimeRewarder:受動的動画からフレーム間時間距離で密報酬を学習強化学習/報酬設計2025/9/1
フレーム間の時間距離をモデル化し、ロボット実演や人間動画からタスク進捗を推定して強化学習の密報酬を生成する手法を提案。
- 事前強化学習:限られた試行回数での目標条件付き動的マニピュレーションマニピュレーション2025/5/1
少数の実演から条件付き拡散モデルで運動マニフォールドを学習し、低次元条件空間でのフィードバック最適化により、10回程度の試行で新しい動的マニピュレーション目標を達成するフレームワークを提案。
- Imitation Learning from Observation with Automatic Discount Scheduling2023/10/1
- Generative Partial Visual-Tactile Fused Object Clustering2020/12/1