Haoxuan Xu
The Hong Kong University of Science and Technology
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MVG-WAM: ロボットマニピュレーションのための多視点幾何認識型ワールドアクションモデルマニピュレーション2026/9/29
多視点カメラの幾何学的関係を明示的に組み込んだワールドアクションモデルを提案し、LIBEROやRoboTwin 2.0で高い成功率を達成した。
- SLIP-VLA: 視覚言語行動モデルのための単一ステップ潜在想像による方策学習VLA2026/9/27
VLAモデルに1回のデノイズ更新で未来の潜在表現を生成する「単一ステップ潜在想像」を導入し、幾何・意味特徴との整合と行動条件付き世界モデルで未来を考慮した行動予測を効率化した手法。
- HCSG: 視覚言語ナビゲーションのための人間中心の意味・幾何推論ナビゲーション2026/5/1
動的な人間環境での視覚言語ナビゲーションにおいて、人間の行動意図を理解するための人間中心フレームワークを提案し、幾何予測と意味解釈を統合して社会的に適切なナビゲーションを実現する。
- マスク世界モデル:ロバストなロボット政策学習のための重要要素予測VLA2026/4/1
動画生成事前学習に基づく世界モデルがロボット政策学習に有望だが、RGB予測は背景や照明などの無関係な要素に過適合しがち。本論文では、ピクセルではなくセマンティックマスクの進化を予測するマスク世界モデル(MWM)を提案し、幾何学的情報ボトルネックにより物理ダイナミクスと接触関係を捉えつつ視覚ノイズを除去。拡散ベースの政策ヘッドと統合し、LIBEROやRLBenchでSOTAを達成し、実世界実験でもロバスト性を示した。
- GGD-SLAM: 動的環境向け汎用運動モデルを活用した単眼3DGS SLAMSLAM2026/4/1
動的環境下でのカメラ位置推定と高精細な稠密マッピングを、事前の意味注釈や深度入力なしで実現する、汎用運動モデルを用いた単眼3DGS SLAMフレームワークを提案した。
- P$^{3}$Nav: 視覚と言語によるナビゲーションのためのエンドツーエンドの知覚・予測・計画ナビゲーション2026/3/1
視覚と言語によるナビゲーション(VLN)タスクにおいて、知覚・予測・計画を統合したエンドツーエンドのフレームワークを提案し、シーン理解を強化してナビゲーション成功率を向上させた。
- 実世界の屋内ツアー動画から得たマルチモーダルイベント知識による視覚言語ナビゲーションの強化VLA2026/2/1
実世界の屋内動画からマルチモーダル時空間知識グラフを構築し、粗い指示や長期的推論を要する視覚言語ナビゲーションにイベント知識を統合する手法を提案した論文。
- ウェーブレットポリシー:世界事前記憶を用いたスケール領域での模倣学習模倣学習2025/4/1
背景画像から持続的なシーン構造を記憶トークンとして符号化し、ウェーブレット変換で行動をマルチスケールに分解して予測する軽量な模倣学習フレームワークを提案。実機を含む多数のタスクで高精度を達成。