Qiao Sun
Fudan University
収録論文 20本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GeoLAM: ラベルなし人間動画から幾何学的潜在行動を学習VLA2026/9/15
人間の動画から幾何学的な手がかりを活用して潜在行動を学習し、ロボット操作タスクに転移するフレームワークを提案。
- 4D-WAM: 軌跡フィールドによる世界行動モデルへの時空間認識の注入VLA2026/8/1
ロボットの行動生成と動画予測を統合する世界行動モデルに対し、3D軌跡フィールドからの時空間知識を表現整合で注入する訓練戦略を提案し、空間理解と実行精度を向上させた。
- 接触を伴うロボット操作のための表現整合型触覚グラウンディング触覚/VLA/操作2026/7/1
触覚強化型VLAポリシーにおいて、将来の触覚状態を予測する中間表現の位置を特定し、軽量な潜在触覚予測器(LTP)を導入して行動表現と接触結果を整合させる手法を提案した。実機の接触を伴う操作タスクで有効性を実証した。
- Xiaomi-Robotics-1: 10万時間以上の実世界軌道データによる視覚言語行動モデルのスケーリングVLA2026/7/1
10万時間以上の実世界の操作軌跡データを用いて、汎用的な視覚言語行動(VLA)モデルを事前学習し、未見環境での指示追従や少量データでの適応を可能にする基盤モデルを構築した。
- ロングテール状況での軌道変位は安全か?自動運転評価2026/6/1
自動運転のプランナー評価を、専門家軌道と比較した際の追加脅威検出として定式化し、人間のアノテーションと検証システムを組み合わせたFluidTestパイプラインを提案した。
- アクションイメージ:マルチビュー動画生成によるエンドツーエンド方策学習VLA2026/4/1
ロボットの7自由度動作をピクセルに接地したアクション動画として表現し、動画生成モデル自体を方策として用いる統一的な世界行動モデルを提案した。RLBenchと実機評価で高いゼロショット成功率を達成した。
- Xiaomi-Robotics-0:リアルタイム実行可能なオープンソース視覚言語行動モデルVLA2026/2/1
大規模なロボット軌道と視覚言語データで事前学習し、非同期実行のための学習技術と展開時のタイムステップ調整により、民生用GPUで高速かつ滑らかなリアルタイム動作を実現したVLAモデルを提案。
- プリミティブ身体性ワールドモデルの学習:スケーラブルなロボット学習に向けてワールドモデル2025/8/1
動画生成ベースの身体性ワールドモデルを固定短時間のプリミティブ動作に限定し、言語と動作の細粒度対応・データ効率・推論速度を改善するPEWMを提案。VLMプランナとヒートマップ誘導で閉ループ制御と長期タスクへの組合せ汎化を実現する。
- 歩みを止めず:選択的敵対的訓練による頑健なヒューマノイド運動スキルの学習歩行2025/7/1
脆弱な状態と行動を選択的に攻撃する敵対的訓練手法を提案し、ヒューマノイドの長期運動・全身体制御の頑健性を向上させた。
- TesserAct: 4D身体化世界モデルの学習世界モデル2025/4/1
RGB-DN動画を生成するビデオモデルを微調整し、身体化エージェントの行動に応じた4Dシーン予測を可能にする世界モデルを提案。
- 静的摩擦がロボット強化学習のSim2Realに与える影響sim2real2025/3/1
ロボット関節の静的摩擦を考慮したドメインランダム化を提案し、従来手法やActuator Netより実機移行性能が高いことを示した。
- Grasp Diffusion Network: 部分点群からSO(3)×R3上の拡散モデルで把持姿勢を生成マニピュレーション2024/12/1
単視点の部分点群から、回転多様体上の拡散モデルと衝突回避コスト誘導を用いて把持姿勢を生成し、実世界で90%の成功率を達成した。
- Mixture of Expertsによる自動運転モーションプランナーの汎化自動運転/プランニング2024/10/1
ViTエンコーダとMixture-of-Experts因果Transformerを組み合わせたスケーラブルなモーションプランナーSTR2を提案し、NuPlanデータセットで従来手法より高い汎化性能とスケーラビリティを示した。
- Large Trajectory Models are Scalable Motion Predictors and Planners2023/10/1
- Boosting Offline Reinforcement Learning for Autonomous Driving with Hierarchical Latent Skills2023/9/1
- P4P: Conflict-Aware Motion Prediction for Planning in Autonomous Driving2022/11/1
- InterSim: Interactive Traffic Simulation via Explicit Relation Modeling2022/10/1
- VectorFlow: Combining Images and Vectors for Traffic Occupancy and Flow Prediction2022/8/1
- M2I: From Factored Marginal Trajectory Prediction to Interactive Prediction2022/2/1
- DenseTNT: Waymo Open Dataset Motion Prediction Challenge 1st Place Solution2021/6/1