Qi Wu
Australia Institute for Machine Learning
収録論文 49本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- NavHarness: 生涯身体性ナビゲーションに向けてナビゲーション2026/9/28
記憶処理をナビゲーションループに組み込み、地図や過去の探索記録を観測と照合しながら訂正・蓄積する訓練不要の身体性ナビゲーション手法を提案。GOAT-Benchなどで大幅な性能向上を達成。
- Talk2Escape: 対話による視覚言語ナビゲーションの閉ループ化視覚言語ナビゲーション2026/9/23
ナビゲーションエージェントの迷走を検知したら対話で修正指示を求める仕組みを提案し、シミュレータと実機で成功率と頑健性を向上させた。
- GPT-6-Astraによる連続環境でのゼロショット視覚言語ナビゲーションの行動分析ナビゲーション2026/9/17
GPT-6-Astraをゼロショットの視覚言語ナビゲーションに適用し、指示理解と行動提案の挙動を分析した。成功率52%だが、局所判断と自律完遂の間にギャップがあることを示した。
- 基盤モデルを物理世界エージェントに組み込むことで長期的ナビゲーションの限界を押し広げるナビゲーション2026/8/31
VLMによる推論エージェントとナビゲーション基盤モデルを組み合わせたフレームワークNavMCPを提案し、長期的な探索タスクで高い性能を達成した。
- 身体化シーン再配置計画タスク計画2026/8/27
エージェントが自己中心視覚とトップダウン目標レイアウトのみを用いて3Dシーン内の家具を目標配置に再配置する新しいタスクを提案し、ベンチマークとベースライン手法を提供した。
- HyperDCM: 双曲空間における動的クラスタメモリリプレイによる継続的ロボットナビゲーションナビゲーション2026/7/1
視覚ナビゲーションの継続学習における破滅的忘却を防ぐため、シーングラフと双曲空間のメモリリプレイを組み合わせた手法を提案した。
- 具現化エージェントが制御を握る:視覚言語ナビゲーションにおける最小インターフェースのゼロショットエージェントが産業規模ポリシーに匹敵ナビゲーション2026/7/1
汎用エージェントが単眼RGBカメラと離散行動のみでゼロショットナビゲーションを実行し、訓練済みポリシーなしで高い成功率を達成できることを示した。
- 領域到達からインスタンスレベルの接地へ:視覚と言語によるナビゲーションの改善VLA2026/7/1
VLNエージェントの最終位置の精度と対象物の可視性を評価する指標を導入し、最終段階のナビゲーションを改善するモジュールREALMを提案した。
- 報酬が見合うときだけ質問する:コストを考慮したオープンエンド対話によるインスタンス目標ナビゲーションナビゲーション2026/6/2
インスタンス目標ナビゲーションにおいて、曖昧な指示を解決するためのオラクルへの質問コストを考慮し、情報利得に基づいて質問タイプと重みを学習し、効率的な対話ナビゲーションを実現する手法を提案した論文。
- 具現化エージェントアーキテクチャ設計の自動化エージェントアーキテクチャ探索2026/6/1
具現化エージェントのアーキテクチャ設計を自動化する手法を提案し、視覚言語ナビゲーションや操作タスクで有効性を検証した。
- NVIDIA OmniDreams: 閉ループ自動運転シミュレーションのためのリアルタイム生成ワールドモデル自動運転シミュレーション2026/6/1
自動運転の閉ループシミュレーション向けに、拡散モデルを基盤としたリアルタイム生成ワールドモデルOmniDreamsを提案し、運転行動に応じたセンサ映像を自己回帰的に生成することで、従来の再構成ベースのシミュレータでは困難な長尾シナリオを合成可能にした。
- SpatialAnt: 能動的なシーン再構築と視覚的予測による自律ゼロショットロボットナビゲーションナビゲーション2026/3/1
ロボットが未知環境を事前探索して自己構築した不完全な3D再構築を用いて、ゼロショットで言語指示によるナビゲーションを実現するフレームワークを提案した。物理的接地によるスケール回復と視覚的予測による経路の反実仮想推論で性能を向上させた。
- ピア観察は役立つのか?視覚言語ナビゲーションのための視覚共有コラボレーションナビゲーション/マルチエージェント2026/3/1
複数のロボットが同じ環境をナビゲートする際、互いの観察情報を共有することで視覚言語ナビゲーションの性能が向上するかを検証するフレームワークCo-VLNを提案し、R2Rベンチマークで効果を実証した。
- 万物を導く一つのエージェント:明示的な世界表現によるMLLMの視覚言語ナビゲーション強化VLA2026/2/1
MLLMを用いたナビゲーションで、低レベル空間推定と高レベル意味計画を分離し、インタラクティブな計量世界表現と反事実推論を導入することで、ゼロショットで最先端性能を達成し、実機移行も実証した。
- SpatialNav: 空間シーングラフを活用したゼロショット視覚言語ナビゲーションナビゲーション2026/1/1
環境を事前探索して空間シーングラフを構築し、エージェント中心の地図と方位合わせした視覚表現、遠隔物体位置推定を組み合わせることで、ゼロショット視覚言語ナビゲーションの性能を大幅に向上させた。
- Arcadia: 身体性生涯学習のためのフルライフサイクルフレームワークに向けて身体性生涯学習2025/12/1
実世界でのデータ収集・生成的なシーン再構成・共有身体表現・sim-from-real評価を密結合した閉ループにより、身体性エージェントの生涯学習と汎化を実現するフレームワークを提案。
- VLN-MME:言語誘導視覚ナビゲーションエージェントとしてのMLLMの診断VLA2025/12/1
視覚と言語によるナビゲーション(VLN)タスクでMLLMをゼロショットエージェントとして評価する統一ベンチマークVLN-MMEを提案し、CoT推論や自己反省を加えると性能が低下するなど、 embodiedナビゲーションにおけるMLLMの空間推論の弱さを明らかにした。
- VLNVerse:多様・身体性・リアルなシミュレーションと評価を備えた視覚言語ナビゲーションのベンチマークVLN2025/12/1
視覚言語ナビゲーション(VLN)の既存ベンチマークの限界を克服するため、多様なタスクを統合し、物理エンジンによる身体性とリアルなシミュレーションを実現した大規模ベンチマークVLNVerseを提案し、既存手法の評価と統合マルチタスクモデルを提示した。
- Fast-SmartWay: パノラマ不要のエンドツーエンドゼロショット視覚言語ナビゲーションVLA2025/11/1
正面のRGB-D画像3枚と言語指示のみからMLLMが直接行動を予測するゼロショットVLN-CEフレームワークを提案し、パノラマ観測とウェイポイント予測器を排除して遅延を大幅に削減した。
- SimULi: アンセンテッド変換を用いたLiDARとカメラのリアルタイムシミュレーションsim2real2025/10/1
3Dガウシアンスプラッティングを拡張し、任意のカメラモデルとLiDARデータをリアルタイムで高忠実度にレンダリングする手法を提案。
- 身体性ナビゲーション基盤モデルナビゲーション基盤モデル2025/9/1
四足歩行・ドローン・車輪ロボット・車両にまたがる800万件のナビゲーションサンプルで学習し、視覚言語ナビゲーションや物体探索、追跡、自動運転など多様なタスクを単一アーキテクチャでこなす基盤モデルを提案。
- 再帰的視覚想像と適応的言語接地による視覚言語ナビゲーションVLA2025/7/1
視覚言語ナビゲーションにおいて、履歴視覚情報を再帰的に要約し、言語命令と適応的に整合させることで、長系列のナビゲーション判断を改善する手法を提案した論文。
- ドリブルマスター:脚式移動による俊敏なヒューマノイドドリブルの学習歩行2025/5/1
二段階カリキュラム強化学習と仮想カメラモデルを用いて、ヒューマノイドロボットがシミュレーションでドリブル技能を獲得し、実機へ転移できることを示した研究。
- BadNAVer: 視覚言語ナビゲーションに対するジェイルブレイク攻撃の探索VLA2025/5/1
MLLM駆動の視覚言語ナビゲータに対する初の体系的なジェイルブレイク攻撃を提案し、シミュレータと実機で90%超の攻撃成功率を示した。
- NeuroLoc: 脳のナビゲーション細胞を模倣した6自由度カメラ自己位置推定自己位置推定2025/5/1
グリッド細胞・プレイス細胞・頭方向細胞に着想を得て、単一画像から6自由度のカメラ位置姿勢を推定する手法を提案し、屋内・屋外ベンチマークで複雑環境でのロバスト性を向上させた。
- LLM推論による動的で雑然とした環境でのモーションエージェントのナビゲーションナビゲーション2025/3/1
環境・エージェント・経路を離散トークンとして符号化し、LLMを空間推論器として用いることで、動的障害物回避やマルチエージェント協調を再学習なしで実現するフレームワークを提案。
- COSMO: 選択的記憶の組み合わせによる低コスト視覚言語ナビゲーションVLA2025/3/1
視覚言語ナビゲーション(VLN)において、状態空間モジュールとトランスフォーマーを統合し、選択的状態空間モジュール(RSSとCS3)を導入することで、高性能と低計算コストを両立する新アーキテクチャCOSMOを提案した。
- SmartWay: ゼロショット視覚言語ナビゲーションのためのウェイポイント予測とバックトラッキングの強化VLA2025/3/1
連続環境での視覚言語ナビゲーションにおいて、改良されたウェイポイント予測器とMLLMベースのナビゲータを組み合わせ、履歴推論とバックトラッキングを可能にしたゼロショットフレームワークを提案。
- 連続環境における地上視点の視覚と言語によるナビゲーションVLA2025/2/1
低視点の四足ロボット向けに、重み付き履歴観測と接続グラフ転移を用いて視覚と言語によるナビゲーションの汎化性能を高めるGVNavを提案した論文。
- SAME: 状態適応型エキスパート混合による汎用言語誘導視覚ナビゲーションの学習ナビゲーション2024/12/1
異なる粒度の言語指示による7つのナビゲーションタスクを統一的に扱うため、状態に応じて専門家を切り替えるMixture of ExpertsモデルSAMEを提案し、タスク特化型エージェントに匹敵する性能を実現した。
- お手伝いわんちゃんボット:脚式ロボットと視覚言語モデルによるオープンワールド物体取得マニピュレーション2024/10/1
四足歩行ロボットにグリッパと視覚言語モデルを組み合わせ、未知の屋内環境で指示に従って物を取ってくるシステムを実現した。
- Open-Nav: オープンソースLLMによる連続環境でのゼロショット視覚言語ナビゲーションの探求VLA2024/9/1
オープンソースLLMを使い、連続環境でのゼロショット視覚言語ナビゲーションを実現するOpen-Navを提案。時空間Chain-of-Thought推論と詳細な物体・空間知識でシーン認識を強化し、閉源LLMに匹敵する性能を示した。
- 指示を超えてナビゲート:障害物環境における視覚と言語によるナビゲーションナビゲーション2024/7/1
視覚と言語によるナビゲーション(VLN)において、予期せぬ障害物による指示と現実の不一致に対応するため、R2R-UNOデータセットを構築し、適応的にナビゲートするObVLN手法を提案した。
- NavGPT-2:大規模視覚言語モデルのナビゲーション推論能力を引き出すVLA2024/7/1
凍結した大規模言語モデルに視覚情報を整合させ、ナビゲーション方策ネットワークと組み合わせることで、視覚言語ナビゲーションタスクにおける推論能力と行動予測性能を向上させた研究。
- HumanPlus:ヒューマノイドの人間動作模倣とシャドーイング模倣学習2024/6/1
人間の動作データセットとRGBカメラによるリアルタイムシャドーイングを組み合わせ、ヒューマノイドが自律的に多様なタスクを模倣学習できるフルスタックシステムを構築した。
- TON-VIO: 高ダイナミックモーションVIOにおけるロバストな時間同期のためのオンライン時間オフセットモデリングネットワークVIO2024/3/1
低コストVIOの時間ずれをオンラインで補正するため、特徴速度推定と時間オフセット予測のニューラルネットワークを導入し、高ダイナミック動作時の位置推定精度を向上させた。
- Thermal-NeRF: 赤外線カメラによるニューラル放射輝度場NeRF/赤外線2024/3/1
赤外線画像のみからNeRFを構築する初の手法を提案し、暗所や遮蔽物がある劣悪環境でも高品質な3D再構成を実現した。
- NaVid: ビデオベースVLMが視覚言語ナビゲーションの次の一歩を計画するVLA2024/2/1
単眼RGBカメラの動画ストリームのみから次の行動を出力するビデオベース大規模視覚言語モデルNaVidを提案し、地図・オドメトリ・深度なしでシミュレーションと実世界の両方で最先端のナビゲーション性能を達成した。
- Explicit Interaction for Fusion-Based Place Recognition2024/2/1
- AerialVLN: Vision-and-Language Navigation for UAVs2023/8/1
- NavGPT: Explicit Reasoning in Vision-and-Language Navigation with Large Language Models2023/5/1
- Custom Sine Waves Are Enough for Imitation Learning of Bipedal Gaits with Different Styles2022/4/1
- Bridging the Gap Between Learning in Discrete and Continuous Environments for Vision-and-Language Navigation2022/3/1
- Adaptive Mimic: Deep Reinforcement Learning of Parameterized Bipedal Walking from Infeasible References2021/12/1
- Communicative Learning with Natural Gestures for Embodied Navigation Agents with Human-in-the-Scene2021/8/1
- Semantics for Robotic Mapping, Perception and Interaction: A Survey2021/1/1
- P3-LOAM: PPP/LiDAR Loosely Coupled SLAM with Accurate Covariance Estimation and Robust RAIM in Urban Canyon Environment2020/12/1
- Attention-SLAM: A Visual Monocular SLAM Learning from Human Gaze2020/9/1
- Vision-and-Language Navigation: Interpreting visually-grounded navigation instructions in real environments2017/11/1