Mu Xu
Amap, Alibaba Group
収録論文 33本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 自己中心的全身体人間データの事前学習による汎用人型ロコマニピュレーションモデルVLA2026/9/30
ウェアラブルシステムで収集した500時間の自己中心的人間行動データセットHumanVerse-500を構築し、それを用いた3段階学習で人型ロボットの全身視覚言語行動ポリシーλ0を開発した。
- EgoHumanoid-V2: 全身協調ロコマニピュレーションのための人間からヒューマノイドへのスキル転移VLA2026/9/29
一人称視点の人間のデモデータから、全身協調を保ったままロコマニピュレーションスキルをヒューマノイドへ直接転移する枠組みを提案し、実機4タスクでゼロショット転移を実現した。
- 文脈内ロボット学習の簡素化:マニピュレーションタスクのための民主化レシピマニピュレーション2026/9/29
ロボットの文脈内学習(ICL)の曖昧さを解消する問題定義を提示し、視覚プロンプトエンコーダと低コストデータ収集で構成される再現可能なフレームワークSimpleICLを開発、シミュレーションと実世界で高性能を達成した。
- ABot-World-0: 単一デスクトップGPU上での無限インタラクティブワールドロールアウトワールドモデル2026/7/21
単一のデスクトップGPUでリアルタイムに長時間のインタラクティブなビデオ生成を実現するアクション条件付きワールドモデルを提案し、データ収集から推論最適化までを統合したシステムを構築した。
- ABot-N1: 汎用視覚言語ナビゲーション基盤モデルへの一歩ナビゲーション2026/7/1
視覚と言語を統合したナビゲーション基盤モデルABot-N1を提案。認知と制御を分離し、ピクセル目標と明示的な推論で汎用性・堅牢性・解釈性を両立する。
- ABot-M0.5: 移動と操作を統合した世界行動モデルVLA/移動操作2026/7/1
移動操作ロボットのための世界行動モデルを提案し、時間粒度・行動空間・学習と推論の整合性を揃えることで、長期的なタスク実行の精度とロバスト性を向上させた。
- ST-WAM: 視覚分布シフト下でのロバストな操作のための意味的時間的世界行動モデル操作2026/7/1
視覚分布の変化に頑健なロボット操作のため、DINOv3特徴を共有表現として用いる意味的時間的世界行動モデル(ST-WAM)を提案し、将来予測と履歴検索を改善した。
- 四足ロボットのための行動基盤:ABot-C0 テクニカルレポート四足歩行2026/7/1
四足ロボット向けの汎用動作制御システムABot-C0を提案し、大規模データパイプラインとフローマッチングポリシーにより、動作追跡のスケーリング則を初めて実証した。
- ABot-AgentOS: 生涯マルチモーダルメモリを備えた汎用ロボットエージェントOSエージェントOS2026/7/1
低レベル制御の上に推論・記憶・ツール使用・検証・クロス実体実行を提供する汎用ロボットエージェントOSを提案し、実行可能なベンチマークと永続的なマルチモーダルグラフメモリを導入した。
- DLAM: 時間的制約を伴う分布型潜在アクションVLA2026/7/1
本論文は、ロボットの行動データ不足を補うため、行動ラベルなしのビデオから潜在アクションを学習する新しいモデルDLAMを提案する。各遷移を対角ガウス分布として表現し、時間的整合性を保ちながら再構成誤差の伝播を抑えることで、ロボットポリシー学習の性能を向上させる。
- ABot-Earth 0.5: 生成型3D地球モデル3D生成2026/6/8
衛星画像から広大な3D環境を生成する生成モデルを提案し、3Dガウススプラッティングを用いてリアルな都市景観を高速に合成する。
- 多視点潜在事前分布による行動多様体学習を用いたロボット操作VLA2026/5/1
単眼入力の奥行き曖昧性を解決するため、事前学習済み多視点拡散モデルで潜在的な新視点を合成し、3次元幾何学的ガイダンスで多視点特徴を整列するG3Tと、有効な行動多様体上で直接行動を予測するAMLを提案した。
- DeepSight: 潜在状態予測による長期的世界モデリングを用いたエンドツーエンド自動運転自動運転2026/5/1
自動運転のための世界モデルを提案し、BEV空間で将来フレームの潜在意味特徴を並列予測することで長期的な状態予測を行い、さらに適応的なテキスト推論で長尾シナリオの性能を向上させ、閉ループベンチマークでSOTAを達成した。
- 代数的一貫性を持つ潜在アクションモデル:視覚・言語・行動モデルのためのALAMVLA2026/5/1
アクションラベルなしの動画から潜在アクションを学習し、代数的一貫性(合成・可逆性)を課すことで、VLAモデルの生成に適した構造化された潜在遷移を獲得する手法を提案した。
- POINav: 実世界の視覚言語ナビゲーションにおける最終メートル到達のベンチマークと性能向上ナビゲーション2026/5/1
実世界のPOI(関心地点)ゴールナビゲーションのための初のクローズドループ評価ベンチマークPOINav-Benchを構築し、POI推論を行うBrainモジュールと連続ウェイポイント予測を行うActionモジュールからなるフレームワークを提案した。
- 人間のように探索する:身体化エージェントのためのオンラインSGメモ構築による自律探索探索2026/4/21
本論文は、大規模視覚言語モデルを用いて意味的ナビゲーション可能性を抽出し、階層的なSGメモをオンラインで構築しながら探索を行うことで、効率的な環境探索を実現するフレームワークABot-Explorerを提案する。
- ABot-Claw: 持続的・協調的・自己進化型ロボットエージェントの基盤VLA/エージェント基盤2026/4/11
OpenClawを拡張し、異種ロボットの協調、視覚中心のマルチモーダル記憶、批評家ベースの閉ループフィードバックを統合することで、実世界での長期的・自己進化的なロボットエージェントを実現する基盤を提案した。
- AsyncShield: 非同期クラウドベースVLAナビゲーションのためのプラグアンドプレイエッジアダプタナビゲーション2026/4/1
クラウド上のVLAモデルの遅延による空間的ずれを、物理的な白箱マッピングと強化学習で補正する非同期制御フレームワークを提案。
- ニューラル暗黙アクションフィールド:視覚-言語-行動モデルのための離散ウェイポイントから連続関数へVLA2026/3/1
VLAモデルの行動表現を離散ウェイポイントから連続時間の行動関数へ再定式化し、任意の時間分解能で滑らかな制御を可能にした手法を提案。
- ABot-PhysWorld: 物理整合を備えたロボット操作のための対話型世界基盤モデル世界モデル2026/3/1
物理的に不自然な操作動画を生成する問題を解決するため、物理認識アノテーション付きの大規模データセットとDPOベースの後訓練を導入し、物理的に妥当で行動制御可能な動画を生成する世界モデルを提案した。
- 屋内・屋外のギャップを埋める:最後の数メートルに向けた視覚中心の指示誘導型身体性ナビゲーションナビゲーション2026/2/1
正確な座標に頼らず、一人称視覚と指示のみで屋外から屋内へシームレスに移動する新しいナビゲーションタスクを提案し、画像ベースのプロンプトで意思決定する視覚中心フレームワークと初のオープンソースデータセットを構築した。
- ABot-N0:多様な身体性ナビゲーションのためのVLA基盤モデルに関する技術報告VLA2026/2/1
5種類のナビゲーションタスクを統一的に扱うVLA基盤モデルABot-N0を提案し、大規模データセット構築と7ベンチマークでのSOTA達成、実環境での長期ミッションを可能にした。
- ABot-M0: 行動多様体学習によるロボットマニピュレーションのためのVLA基盤モデルVLA2026/2/1
異種ロボットデータを統合した大規模データセットUniACTを構築し、行動が低次元多様体上に存在するという仮説に基づくAction Manifold Learningで効率的なVLA基盤モデルを実現した。
- MerNav: ゼロショット物体目標ナビゲーションのための高汎化メモリ・実行・レビューフレームワークナビゲーション2026/2/1
メモリ・実行・レビューの3モジュールからなるフレームワークを提案し、ゼロショット物体目標ナビゲーションにおいて成功率と汎化性能を両立させ、実機ヒューマノイドでも検証した。
- FantasyVLN: 視覚言語ナビゲーションのための統合マルチモーダル思考連鎖推論VLA2026/1/1
視覚言語ナビゲーションにおいて、想像上の視覚トークンを潜在空間に圧縮して思考連鎖推論を行い、リアルタイム動作を実現する統合フレームワークを提案。
- NavForesee:階層的計画と二重時間軸ナビゲーション予測のための統合視覚言語ワールドモデルVLA2025/12/1
単一の視覚言語モデルで、言語指示の分解・進捗追跡による高レベル計画と、短期環境変化・長期マイルストーンの予測を同時に行い、屋内ナビゲーション性能を向上させた研究。
- AstraNav-Memory: 長期記憶のための文脈圧縮ナビゲーション2025/12/1
画像中心の記憶を視覚的文脈圧縮で効率的に保持し、Qwen2.5-VLベースのナビゲーション方策と組み合わせて長期的な身体性ナビゲーションを実現した研究。
- SocialNav: 社会規範を考慮した具身ナビゲーションのための人間模倣基盤モデルナビゲーション2025/11/1
社会規範を理解し遵守するナビゲーションを実現するため、700万サンプルのデータセットと階層型「脳-行動」アーキテクチャ、強化学習手法SAFE-GRPOを組み合わせた基盤モデルを提案し、成功率と社会規範遵守率を大幅に向上させた。
- 交通規則を持続的に自己回帰マッピングする自動運転フレームワーク自動運転/HDマップ2025/9/1
視覚情報から車線ベクトルと交通規則を自己回帰的に同時構築し、規則の持続的な有効性を保つPAMRを提案した論文。
- JanusVLN: 二重暗黙メモリで意味と空間を分離する視覚言語ナビゲーションVLA2025/9/1
人間の左右脳のように意味理解と空間認知を別々の固定サイズの暗黙的ニューラルメモリで表現し、冗長な計算を抑えつつ効率的に視覚言語ナビゲーションを行うフレームワークを提案した。
- CE-Nav: フロー誘導強化学習による形態横断型ローカルナビゲーションの精緻化ナビゲーション2025/9/1
模倣学習で形態非依存の汎用ナビゲーション方策を学習し、強化学習で各ロボットの動特性に適応させる2段階フレームワークを提案。四足・二足・ドローンで高精度かつ低適応コストを実現。
- World-Env: ワールドモデルを仮想環境として活用するVLAポストトレーニングVLA2025/9/1
物理的に整合性のあるワールドモデルを仮想シミュレータとして使い、VLAモデルを強化学習でポストトレーニングする枠組みを提案。タスクごとに5件の実演データだけで複雑なマニピュレーション性能を向上させる。
- OmniNav:探索と視覚言語ナビゲーションを統合するフレームワークナビゲーション2025/9/1
指示・物体・地点ゴールナビゲーションとフロンティア探索を単一アーキテクチャで扱う統合ナビゲーションフレームワークを提案し、高速・低速モジュール連携で経路効率と汎化性能を向上させた。