Xu Yan
Huawei Foundation Model Department
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Robust-WAM:生成事前学習と意味的先見を橋渡しするワールドアクションモデルVLA2026/8/1
ビデオ生成モデルの事前学習を活かしつつ、意味的潜在空間での先見アライメントを追加することで、見た目の変化に頑健なロボット制御を実現するポストトレーニング手法を提案した。
- DiSCo: 共有自律のための拡散シーケンスコパイロット共有自律制御2026/3/1
共有自律制御において、拡散ポリシーを用いてユーザーの行動履歴に整合する行動シーケンスを計画する手法DiSCoを提案し、シミュレーションの運転・ロボットアームタスクで性能を向上させた。
- DualCoT-VLA: 視覚と言語の連鎖的推論を並列化した視覚言語行動モデルVLA2026/3/1
複雑なタスクで苦戦するVLAモデルに対し、視覚的CoTと言語的CoTを並列に統合し、推論遅延を減らして高性能を実現した。
- S-VAM: 幾何学的・意味的先読みの自己蒸留によるショートカット動画行動モデルロボット学習/VLA2026/3/1
動画行動モデル(VAM)の推論速度と先読み精度のトレードオフを解決するため、単一パスで幾何・意味表現を予測するショートカットモデルS-VAMを提案。多段階拡散の生成事前知識を一段階推論に凝縮する自己蒸留戦略を導入し、シミュレーションと実世界で高性能を実証した。
- 視線で意図を読む:基盤モデルによる注視誘導型ロボットマニピュレーションマニピュレーション2026/1/1
自己中心視点の視線追跡と視覚言語モデルを組み合わせ、ユーザーの注視から意図を推論して卓上マニピュレーションを自律実行するシステムGAMMAを提案した。
- SQS: 自動運転におけるクエリベーススプラッティングによるスパース知覚モデルの強化自動運転知覚2025/9/1
スパースクエリから3Dガウシアンを予測する自己教師ありスプラッティング事前学習を導入し、占有予測や3D物体検出などの自動運転知覚タスクの性能を向上させた研究。
- Occ-LLM:占有表現を活用した自動運転向け大規模言語モデル自動運転/LLM2025/2/1
占有グリッド表現を大規模言語モデルに統合し、動的物体と静的シーンを分離するMS-VAEで効率的に符号化することで、4D占有予測や自己計画、シーン質問応答の性能を向上させた研究。
- VisionPAD: 自動運転のための視覚中心の事前学習パラダイム自動運転/自己教師あり学習2024/11/1
画像のみを教師信号に3Dガウシアンスプラッティングで多視点表現を再構成し、ボクセル速度推定と多フレーム測光整合性で自動運転向け視覚モデルを自己教師あり事前学習する手法。