Haidong Cao
Fudan University
収録論文 6本 ・ フィジカルAI/ロボット学習
VLAマニピュレーションクロスエンボディメント学習模倣学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 探索・実行・進化:身体性エージェントのためのスキル獲得と再利用ループVLA2026/9/29
視覚と言語に触覚を組み合わせ、スキルライブラリを進化的に更新しながら再利用する枠組みRoboSkillを提案し、ロボットタスクの成功率向上と実行時間短縮を実現した。
- SegDiff: セグメント化軌道拡散による一貫性と適応性を備えたロボット操作マニピュレーション2026/7/1
模倣学習において、連続予測とキーポーズ予測の利点を統合し、キーポーズ間の軌道を拡散モデルで予測する閉ループ視覚運動ポリシーを提案。動的環境への適応性と制御安定性を向上させた。
- GuidedVLA: プラグアンドプレイの行動注意特化によるタスク関連因子の指定VLA2026/5/1
VLAモデルの行動デコーダを機能部品として捉え、個々の注意ヘッドに明示的な補助信号でタスク関連因子(物体接地、空間幾何、時間的スキル論理)を学習させるフレームワークを提案し、シミュレーションと実機で汎化性能を向上させた。
- HiMoE-VLA:汎用視覚言語行動ポリシーのための階層的Mixture-of-ExpertsVLA2025/12/1
異なるロボットの実演データを混ぜて学習する際の負の転移を防ぐため、行動空間ごとに特化する階層的MoE行動モジュールを提案し、CALVINやLIBERO、実機タスクで高い性能を達成した。
- カメラ座標系でロボット動作を統一するクロスエンボディメント学習2025/11/1
カメラ外部パラメータを用いて異なるロボットの動作をカメラ座標系で統一し、訓練不要でカメラ外部パラメータを推定するCalibAllを提案。16データセットで約97Kエピソードを校正し、クロスエンボディメント事前学習で最先端性能を達成。
- Human2Robot: 人間とロボットのペア動画からロボット動作を学習模倣学習2025/2/1
人間とロボットの同期動画ペアを条件付き動画生成問題として扱い、人間の動画からロボットの動画を生成して動作を学習する枠組みを提案。新規データセットH&Rも構築し、未知のタスクへのワンショット汎化を実現した。