Sicheng Xie
Fudan University
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LIBERO-Agent:汎用エージェントによる実機マニピュレーションの評価ベンチマークマニピュレーション2026/9/30
汎用AIエージェントがロボット操作タスクを直接実行できるかを評価する200タスクの対話型ベンチマークLIBERO-Agentを提案し、知覚は得意だが長期的・難しい操作では信頼性が大きく低下することを示した。
- 探索・実行・進化:身体性エージェントのためのスキル獲得と再利用ループVLA2026/9/29
視覚と言語に触覚を組み合わせ、スキルライブラリを進化的に更新しながら再利用する枠組みRoboSkillを提案し、ロボットタスクの成功率向上と実行時間短縮を実現した。
- SegDiff: セグメント化軌道拡散による一貫性と適応性を備えたロボット操作マニピュレーション2026/7/1
模倣学習において、連続予測とキーポーズ予測の利点を統合し、キーポーズ間の軌道を拡散モデルで予測する閉ループ視覚運動ポリシーを提案。動的環境への適応性と制御安定性を向上させた。
- Qwen-VLA:タスク・環境・ロボット形態を横断する視覚言語行動モデルの統合VLA2026/5/1
多様なロボットタスクを単一の視覚言語行動モデルに統合するQwen-VLAを提案し、操作・ナビゲーション・軌道予測を統一フレームワークで扱う。
- FineVLA: 操縦可能な視覚言語行動ポリシーのための細粒度命令整合VLA2026/5/1
ロボットタスクの実行方法に関する細かい指示(腕、方向、接触領域など)をVLAモデルに学習させるためのデータセットとベンチマーク、およびポリシーを構築した。
- カメラ座標系でロボット動作を統一するクロスエンボディメント学習2025/11/1
カメラ外部パラメータを用いて異なるロボットの動作をカメラ座標系で統一し、訓練不要でカメラ外部パラメータを推定するCalibAllを提案。16データセットで約97Kエピソードを校正し、クロスエンボディメント事前学習で最先端性能を達成。
- Ask-to-Clarify: マルチターン対話による指示の曖昧性解消VLA2025/9/1
VLAモデルに対話による曖昧性解消と視覚運動制御を統合したフレームワークを提案し、実世界11タスクで有効性を示した。
- Human2Robot: 人間とロボットのペア動画からロボット動作を学習模倣学習2025/2/1
人間とロボットの同期動画ペアを条件付き動画生成問題として扱い、人間の動画からロボットの動画を生成して動作を学習する枠組みを提案。新規データセットH&Rも構築し、未知のタスクへのワンショット汎化を実現した。