Haoang Li
The Hong Kong University of Science and Technology (Guangzhou)
収録論文 61本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- UniWAM:統合された世界行動モデルVLA2026/10/1
物理推論・映像生成・行動予測を統合したモデルで、人間の一人称視点データとロボットデータを活用し、複数の評価でSOTAを達成した。
- 離散フォーシング:連続デノイジングに離散ガイダンスを注入する少数ステップ行動エキスパートVLA2026/9/30
VLAモデルにおいて、離散行動トークンで粗い行動構造を予測し、それを連続行動の精緻化のガイダンスとして用いるフローマッチング手法を提案。パラメータ数を抑えつつ高精度・高速推論を実現した。
- 報酬誘導型選好最適化による自動運転のための効率的マルチモーダル計画自動運転計画2026/9/30
スパースアンカーとオフセット精緻化を組み合わせたマルチモーダル軌道計画手法を提案し、報酬誘導型ファインチューニングで安全性を高め、NAVSIMベンチマークで精度と効率の両立を実現した。
- MVG-WAM: ロボットマニピュレーションのための多視点幾何認識型ワールドアクションモデルマニピュレーション2026/9/29
多視点カメラの幾何学的関係を明示的に組み込んだワールドアクションモデルを提案し、LIBEROやRoboTwin 2.0で高い成功率を達成した。
- SLIP-VLA: 視覚言語行動モデルのための単一ステップ潜在想像による方策学習VLA2026/9/27
VLAモデルに1回のデノイズ更新で未来の潜在表現を生成する「単一ステップ潜在想像」を導入し、幾何・意味特徴との整合と行動条件付き世界モデルで未来を考慮した行動予測を効率化した手法。
- オープンボキャブラリ・インスタンスナビゲーションのための物体-経路グラフによるトポロジカル表現ナビゲーション2026/9/21
物体と経路を統合したグラフ表現を提案し、密な地図構築なしにオープンボキャブラリな意味推論とトポロジカルナビゲーションを実現した。
- ActiveScale:モデル・データ・ハードウェアを横断したロボットの能動的知覚のスケーリングVLA2026/9/16
視点変更を伴う操作タスクのための能動的知覚フレームワークを提案し、カメラ姿勢を考慮したVLAモデル、1000時間の一人称視点データによる中間学習、単一操作者で遠隔操作可能な移動マニピュレーションプラットフォームを統合した。
- 機能を保つデータ生成によるゼロショット実機-シミュレーション-実機マニピュレーションsim2real2026/9/16
接触を伴うタスクで形状を多様化しても機能的な接触面を保つメッシュ変形により、実機データなしでゼロショットの実機-シミュレーション-実機マニピュレーションを実現する手法を提案。
- ゲームプレイから方策へ:ゲーム化されたロボット不要のインタラクションによるスケーラブルなロボットデータ収集VLA2026/9/16
VRゲームで人間の操作データを収集し、ロボットに転移する枠組みを提案。ゲームから実機へのギャップを埋めるGame2Policyにより、少数の実機デモで成功率が向上することを示した。
- MobileWAM: 世界行動モデルをチェーン・オブ・フォーサイトで移動操作に橋渡しする移動操作2026/8/5
移動操作のための世界行動モデルを提案し、事前学習済みのビデオ拡散トランスフォーマーと軽量な行動エキスパートを融合させ、移動と操作の異種ダイナミクスを扱う。また、中間表現が未来の潜在チャンクを逐次予測するCoFを導入し、実機でも高い性能を示した。
- 前方予測だけで十分か?JEPAワールドモデルのための物理状態接地ワールドモデル2026/8/1
JEPAベースのワールドモデルに、ロボットの自己受容状態と関節角変化を接地する2つの目的を追加し、潜在表現の識別性と下流タスク性能を向上させる手法を提案した。
- SG-WAM: テキスト接地と空間認識を備えた意味的ガイダンスによるワールドアクションモデルVLA2026/8/1
ロボット操作のためのワールドアクションモデルに、VLMを意味プランナーとして用いてテキスト指示に基づく意味的先見を注入し、将来ビデオ生成と行動予測の指示追従精度を向上させる手法を提案した。
- DyPES-VLA: 共有ダイナミクス事前知識と身体固有制御の学習によるクロス身体操作VLA/クロス身体操作2026/8/1
異なるロボット身体間で共有できるダイナミクス事前知識を学習し、身体固有の行動空間で直接制御を出力するVLAモデルを提案。シミュレーションと実機で最高性能を達成した。
- Robust-WAM:生成事前学習と意味的先見を橋渡しするワールドアクションモデルVLA2026/8/1
ビデオ生成モデルの事前学習を活かしつつ、意味的潜在空間での先見アライメントを追加することで、見た目の変化に頑健なロボット制御を実現するポストトレーニング手法を提案した。
- 4D-WAM: 軌跡フィールドによる世界行動モデルへの時空間認識の注入VLA2026/8/1
ロボットの行動生成と動画予測を統合する世界行動モデルに対し、3D軌跡フィールドからの時空間知識を表現整合で注入する訓練戦略を提案し、空間理解と実行精度を向上させた。
- 風の不確実性下におけるトラック支援型マルチUAV配送のためのエネルギー認識型耐風ルーティング配送/経路計画2026/8/1
風の不確実性を考慮し、UAVのエネルギー消費と帰還可能性を安全に管理するオンライン経路計画手法を提案した。
- 拡散モデルに基づくUAV群の4D軌道予測と分散制御群制御2026/6/1
UAV群の安全で効率的な運用のため、粗密な軌道予測と不確実性を考慮した分散非線形モデル予測制御を統合したフレームワークを提案し、軌道追従誤差を10-15%削減した。
- SEDualVLN: 空間強化デュアルシステムによる視覚言語ナビゲーション視覚言語ナビゲーション2026/5/1
視覚言語ナビゲーションの性能を高めるため、空間認識を強化した2つのシステム(VLMとMLLM)を組み合わせたフレームワークを提案し、VLN-CEベンチマークで最高性能を達成した。
- HCSG: 視覚言語ナビゲーションのための人間中心の意味・幾何推論ナビゲーション2026/5/1
動的な人間環境での視覚言語ナビゲーションにおいて、人間の行動意図を理解するための人間中心フレームワークを提案し、幾何予測と意味解釈を統合して社会的に適切なナビゲーションを実現する。
- CapVector: パラメトリック空間における転移可能な能力ベクトルの学習による視覚言語行動モデルの強化VLA2026/5/1
事前学習済みVLAモデルの標準的な教師あり微調整では性能向上が限定的である問題に対し、補助目的の効果をパラメータ差分として抽出し、軽量な正則化で統合する能力ベクトル手法を提案した。
- フィードフォワード3Dモデルを用いた単眼視覚慣性システムの効率的な特徴点フリー初期化視覚慣性初期化2026/5/1
単眼VINSの初期化を、視覚特徴追跡を使わずにフィードフォワード3Dモデルが予測する点群を利用して行う手法を提案し、成功率90%以上・データ所要時間1.2秒未満を達成した。
- RoboMemArena:ロボット記憶のための包括的で挑戦的なベンチマークベンチマーク/VLA/記憶2026/5/1
ロボットの長期タスクにおける記憶能力を評価するため、26タスク・平均1000ステップ超の大規模ベンチマークRoboMemArenaを構築し、VLMによるサブタスク生成と実世界評価を備えた。さらに、記憶管理と予測符号化を統合したVLAモデルPrediMemを提案し、既存手法を上回る性能を示した。
- 風の不確実性環境下における空陸協調マルチUAV配送のためのロバストなエネルギー考慮型ルーティング配送/ルーティング2026/4/1
風の影響を考慮したエネルギー消費モデルに基づき、UAV配送の帰還可能性をリアルタイムに評価するオンライン計画フレームワークを提案し、シミュレーションで成功率を向上させた。
- S-VAM: 幾何学的・意味的先読みの自己蒸留によるショートカット動画行動モデルロボット学習/VLA2026/3/1
動画行動モデル(VAM)の推論速度と先読み精度のトレードオフを解決するため、単一パスで幾何・意味表現を予測するショートカットモデルS-VAMを提案。多段階拡散の生成事前知識を一段階推論に凝縮する自己蒸留戦略を導入し、シミュレーションと実世界で高性能を実証した。
- Fast-dVLA: 離散拡散VLAを実時間性能へ高速化VLA/拡散モデル/ファインチューニング2026/3/1
事前学習済みVLAモデルの性能向上と適応コスト削減を両立するため、補助タスクの能力ベクトルをパラメータ空間で分離・統合する手法を提案し、軽量な正則化で標準SFTと同等の性能を低計算コストで実現した。
- DFM-VLA: 離散フローマッチングによる反復的な行動洗練でロボットマニピュレーションを実現VLA2026/3/1
行動トークンを反復的に洗練する離散フローマッチング型VLAを提案し、初期のトークン誤りを後から修正できるようにしてマニピュレーション精度を向上させた。
- VLA-OPD: オフラインSFTとオンラインRLを架橋する、オンポリシー蒸留による視覚言語行動モデルVLA/強化学習/蒸留2026/3/1
視覚言語行動モデルの事後学習において、オフラインSFTの分布ずれや破滅的忘却と、オンラインRLのスパース報酬や非効率性を解決するため、専門家教師による密なトークンレベル監督を学生の自己生成軌道に適用し、Reverse-KL目的で安定した学習を実現するフレームワークを提案した。
- VAMPO: ビデオ行動モデルの視覚ダイナミクスを改善するポリシー最適化VLA2026/3/1
ビデオ行動モデルのノイズ除去を逐次決定過程とみなし、専門家の視覚ダイナミクスに基づく報酬でポリシー最適化を行うことで、操作に重要な視覚ダイナミクスを直接改善するフレームワークを提案。
- 双腕ロボットにおける座標変換と運動学パラメータの統合キャリブレーションフレームワークキャリブレーション2026/3/1
双腕ロボットの座標変換と運動学パラメータをリー代数に基づく単一の誤差モデルで統合的に校正する新しいフレームワークを提案した。
- ロバストかつ閾値耐性のある幾何推定のための大域打ち切り損失最小化幾何推定2026/3/1
外れ値にロバストな幾何推定のため、大域的分岐限定法(BnB)を用いて打ち切り損失(TL)を初めて統一的に最小化するフレームワークGTMを提案した。探索空間削減とLipschitz連続なバウンド関数により高速化を実現している。
- AERR-Nav: ゼロショット物体ナビゲーションのための適応的探索・回復・回想戦略ナビゲーション2026/3/1
未知の多階建て環境でのゼロショット物体ナビゲーションを改善するため、ロボットの状態を動的に切り替える適応的戦略と、高速・低速思考モードを備えた探索状態を提案した。
- OmniDP: 全方位3D知覚による広視野・大作業空間でのヒューマノイド操作操作2026/3/1
RGB-Dカメラの狭い視野や自己遮蔽の問題を解決するため、LiDARによる全方位点群を時間的注意プーリングで処理するエンドツーエンドの3D視覚運動ポリシーを提案し、ロボットの再配置なしで広い作業空間での操作を可能にした。
- DualCoT-VLA: 視覚と言語の連鎖的推論を並列化した視覚言語行動モデルVLA2026/3/1
複雑なタスクで苦戦するVLAモデルに対し、視覚的CoTと言語的CoTを並列に統合し、推論遅延を減らして高性能を実現した。
- DyGeoVLN: 動的幾何基盤モデルを視覚言語ナビゲーションに統合するVLA2026/3/1
静的シーンを仮定した従来手法の限界を克服するため、動的幾何基盤モデルをVLNフレームワークに統合し、3D空間表現と視覚意味推論を強化。さらに、冗長なトークンを削減する適応的解像度トークンプルーニング戦略を導入し、長期的な動的ナビゲーションの推論コストを削減する。
- P$^{3}$Nav: 視覚と言語によるナビゲーションのためのエンドツーエンドの知覚・予測・計画ナビゲーション2026/3/1
視覚と言語によるナビゲーション(VLN)タスクにおいて、知覚・予測・計画を統合したエンドツーエンドのフレームワークを提案し、シーン理解を強化してナビゲーション成功率を向上させた。
- Dream-SLAM: 動的環境における能動SLAMのための未観測領域の夢生成能動SLAM2026/2/1
部分的に観測された動的環境の時空間画像と意味構造を生成(夢見)し、実観測と融合することで、カメラ姿勢推定・3D地図生成・長期的な探索計画を改善する単眼能動SLAM手法を提案。
- 実世界の屋内ツアー動画から得たマルチモーダルイベント知識による視覚言語ナビゲーションの強化VLA2026/2/1
実世界の屋内動画からマルチモーダル時空間知識グラフを構築し、粗い指示や長期的推論を要する視覚言語ナビゲーションにイベント知識を統合する手法を提案した論文。
- FRAPPE: 複数未来表現アラインメントによる汎用ロボット方策への世界モデリングの注入VLA2026/2/1
未来の観測の潜在表現を予測し、複数の視覚基盤モデルと並列にアラインメントすることで、汎用ロボット方策に世界認識を効率的に組み込む手法を提案。
- 3Dビジョンのための大域ソルバーの進展3Dビジョン最適化2026/2/1
3Dビジョンにおける非凸幾何最適化を証明可能な解で解く大域ソルバー(BnB・凸緩和・GNC)を初めて体系的にサーベイし、10の視覚タスクを通じて最適性・頑健性・スケーラビリティのトレードオフと今後の方向性を示した。
- Vision-language-actionモデルの実用性を再考する:包括的ベンチマークと改良ベースラインVLA2026/2/1
VLAモデルの実用性を評価する新ベンチマークCEBenchを提案し、その知見に基づき軽量で実用的なLLaVA-VLAを開発した。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- 基盤モデル時代の身体性ロボットマニピュレーション:計画と学習の視点マニピュレーション2025/12/1
ロボットマニピュレーションの学習ベース手法を、高レベル計画と低レベル制御の統一的な枠組みで整理したサーベイ。言語・コード・動作・アフォーダンス・3D表現の推論や、入力モデリング・潜在表現学習・方策学習の分類を提示し、課題と展望を論じる。
- 統合拡散VLA:離散デノイジング拡散プロセスによる視覚・言語・行動モデルVLA2025/11/1
視覚・言語・行動を単一の離散デノイジング拡散過程で統合し、画像生成と行動予測を同時に最適化するVLAモデルを提案。CALVINやLIBEROなどで最高性能を達成。
- Spatial Forcing:視覚-言語-行動モデルのための暗黙的な空間表現アラインメントVLA2025/10/1
3D入力や深度推定器に頼らず、VLAモデルの中間視覚埋め込みを事前学習済み3D基盤モデルの幾何表現に揃えることで、空間理解を暗黙的に獲得させ、行動精度と学習効率を向上させる手法を提案。
- ロボットマニピュレーションの統合的理解に向けて:包括的サーベイマニピュレーション2025/10/1
ロボットマニピュレーション研究を、タスク別ベンチマーク・データセット・手法の統一的分類・ボトルネック・実応用まで幅広く整理した包括的サーベイ。
- 脚式ロボットのための信頼度校正知覚とトポロジカルサブゴール選択による意思決定駆動型意味的物体探索歩行2025/9/1
脚式ロボットがノイズの多い意味的観測を信頼度校正で統合し、トポロジカル記憶とサブゴール選択により効率的に物体探索する手法を提案。
- 人間型ロボットによる大型物体の抱え込み:強化学習を用いた全身マニピュレーション全身マニピュレーション2025/9/1
人間の動作事前分布とニューラル符号付距離場を強化学習に統合し、人間型ロボットが大型物体を全身で抱え込む多接触・長時間タスクを実現した。
- FlowVLA: 視覚的思考連鎖による動作推論を用いた視覚-言語-行動モデルVLA2025/8/1
未来フレーム予測の前にオプティカルフローで動作を推論するVisual CoTを導入し、物理的に妥当な予測と高効率なロボット操作を実現した。
- ReconVLA:再構成型視覚-言語-行動モデルによる効果的なロボット知覚VLA2025/8/1
視覚的注意を対象領域に正しく向けるため、注視領域を再構成する拡散トランスフォーマを組み込んだVLAモデルを提案し、精密操作と汎化性能を実証した。
- SkyVLN:都市環境におけるUAVのための視覚言語ナビゲーションとNMPC制御VLA2025/7/1
大規模言語モデルを活用して自然言語指示と視覚情報からUAVを都市環境でナビゲートする枠組みを提案し、NMPCによる障害物回避と軌道追従を統合した。
- RationalVLA:デュアルシステムを備えた合理的視覚言語行動モデルVLA2025/6/1
曖昧・不可能な指示を拒否しつつ、実行可能な指示に基づくロボットアーム操作を行う二重システムの視覚言語行動モデルを提案し、新ベンチマークRAMAで評価した。
- CEED-VLA: 早期終了デコーディングを備えた一貫性視覚-言語-行動モデルVLA2025/6/1
視覚-言語-行動モデルの推論を高速化するため、一貫性蒸留と早期終了デコーディングを導入し、4倍以上の加速を実現した。
- EndoFlow-SLAM: フロー制約付きガウシアンスプラッティングによるリアルタイム内視鏡SLAMSLAM2025/6/1
内視鏡手術向けに、オプティカルフロー損失と深度正則化を導入した3DガウシアンスプラッティングベースのリアルタイムSLAM手法を提案し、静的・動的手術シーンで高精度な再構成とカメラ姿勢推定を実現した。
- 脚式マニピュレータのための学習ベース腕押し制御による対話型ナビゲーション移動マニピュレーション2025/3/1
脚式ロボットが腕を使って障害物を押しのけ、狭い空間でも効率的に移動できる対話型ナビゲーション手法を強化学習で実現した。
- RoboDexVLM:視覚言語モデルによる巧みなロボット操作のためのタスク計画と運動制御VLA2025/3/1
視覚言語モデルを活用し、多様な物体を把持できる巧みなハンドを持つ協働マニピュレータ向けに、自然言語コマンドで長期的タスクを計画・実行するフレームワークを提案した。
- PD-VLA: 並列デコーディングによるアクションチャンキング統合VLAモデルの高速化VLA2025/3/1
アクションチャンキングを統合したVLAモデルの推論を並列固定点反復で高速化するPD-VLAを提案し、成功率を維持しつつ実行周波数を2.52倍に向上させた。
- PG-SLAM: 動的環境におけるフォトリアルで幾何学的に正確なRGB-D SLAMSLAM2024/11/1
ガウススプラッティングを拡張し、動的な人や物体の変形・動きをモデル化しつつ、フォトリアルな前景と静的背景を同時に再構成してカメラ位置推定を行うRGB-D SLAM手法を提案。
- ES-Gaussian: 誤差空間に基づくガウシアン補完による3Dガウシアンスプラッティングマッピング3D再構成/sim2real2024/10/1
低高度カメラと単線LiDARを用い、2D誤差マップから疎な点群を補正するVisual Error ConstructionとLiDAR誘導の3DGS初期化により、高品質な屋内3D再構成を実現するシステムを提案した。
- 非ランバート環境における物理ベースのフォトメトリックバンドル調整SLAM2024/9/1
非拡散反射を含む実環境でカメラ姿勢と3D形状を高精度に推定するため、材質・照明・光路に基づく物理的重みを導入したフォトメトリックバンドル調整法を提案し、非ランバートシーンのSLAM用データセットも構築した。
- RoboDriveチャレンジ:あらゆる条件でいつでもどこでも走行する自動運転知覚2024/5/1
悪天候やセンサ故障など想定外の状況でも頑健に知覚できる自動運転技術を競う2024年RoboDriveチャレンジの報告で、BEV検出や地図セグメンテーションなど4タスクで140チームが参加した。
- ヒューリスティクス誘導パラメータ探索による効率的でロバストな点群位置合わせ点群位置合わせ2024/4/1
点群位置合わせにおいて、ヒューリスティクスを用いて探索空間を削減し、3段階分解で効率的にロバストな剛体変換推定を行う手法を提案した。