Shaoqing Xu
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 視覚基盤モデルによる堅牢なマルチモーダル3D物体検出3D物体検出2026/9/20
自動運転向けにSAMを微調整したSAM-ADとLiDAR特徴を融合し、ノイズや悪天候下でも堅牢な3D物体検出を実現するRoboDistillを提案。
- 一つのポリシー、多様な身体:異種具現化操作のためのカメラ中心の統一アクション幾何学事前学習VLA2026/8/26
異なるロボット形態やカメラ設定をまたいで操作データを統一するため、カメラで観測可能なアンカー動作を共通のアクション表現として用いる新しいフレームワークUCAG-Pを提案。単一のVLAポリシーで複数のベンチマークを高精度に達成した。
- MomADv2: エンドツーエンド自動運転のための信頼性の高い時間的記憶自動運転2026/8/24
運転コマンドの変化に応じて履歴情報を選択的に活用し、コマンドと矛盾する記憶を抑制する信頼性の高い状態空間記憶フレームワークを提案。長期的な計画の一貫性を向上させ、衝突率を低減した。
- SpaAct: 空間活性化遷移学習とカリキュラム適応による視覚言語ナビゲーションVLA/ナビゲーション2026/4/30
視覚言語ナビゲーション(VLN)のためのVLM適応フレームワークSpaActを提案。後方行動推論と前方遷移予測の2つの空間活性化タスクと、TriPAカリキュラム学習により動的空間認識を獲得し、VLN-CEベンチマークでSOTAを達成。
- Xiaomi OneVL: ワンステップ潜在推論と視覚言語説明によるプランニング自動運転/VLA2026/4/1
自動運転のVLAモデルにおいて、潜在推論を視覚世界モデルで強化し、明示的CoTを超える精度を実現しつつ、推論速度を回答のみの予測と同等に高速化したフレームワークを提案した。
- 考える前に進む:画像目標ナビゲーションのための階層的推論ナビゲーション2026/4/1
画像目標ナビゲーションを高レベル計画と低レベル実行に分解し、視覚言語モデルで短期的計画を生成して強化学習ポリシーを導く階層的フレームワークHRNavを提案。迷いを減らすペナルティも導入し、シミュレーションと実環境で有効性を実証した。
- DVGT-2: 大規模自動運転のためのビジョン・ジオメトリ・アクションモデル自動運転2026/4/1
自動運転のための新しいVGAパラダイムを提案し、オンライン推論可能なストリーミング型のDVGT-2を導入。密な3Dジオメトリと軌道計画を同時に出力し、多様なカメラ設定で微調整なしに適用可能。
- 運転視覚幾何Transformer3D再構成2025/12/1
自動運転向けに、カメラパラメータ不要で多視点画像列からメートルスケールの密な3D点群と自車姿勢を推定するTransformerモデルを提案。
- MiMo-Embodied: クロス身体性基盤モデル技術報告VLA2025/11/1
自動運転と身体性AIを統合した初のクロス身体性基盤モデルを開発し、両分野で最先端性能を達成した。
- FPC-VLA:失敗予測と修正のためのスーパーバイザを備えた視覚-言語-行動フレームワークVLA2025/9/1
VLAモデルに失敗予測と修正を行うスーパーバイザを組み合わせ、シミュレーションと実機で成功率を向上させたデュアルモデルフレームワーク。
- DIVER: 強化学習と拡散モデルで模倣学習の限界を突破するエンドツーエンド自動運転自動運転2025/7/1
拡散モデルによる多様な軌道生成と強化学習による安全性・多様性の誘導を組み合わせ、単一専門家の模倣学習が抱えるモード崩壊を解消するエンドツーエンド自動運転フレームワークを提案した。
- ハンドルを振るな:エンドツーエンド自動運転におけるモメンタムを考慮した計画自動運転計画2025/3/1
過去の軌道と知覚の履歴を活用して軌道予測を安定化させるMomADを提案し、nuScenesで長期的な一貫性と衝突率の改善を達成した。