Zerui Li
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- NavHarness: 生涯身体性ナビゲーションに向けてナビゲーション2026/9/28
記憶処理をナビゲーションループに組み込み、地図や過去の探索記録を観測と照合しながら訂正・蓄積する訓練不要の身体性ナビゲーション手法を提案。GOAT-Benchなどで大幅な性能向上を達成。
- Talk2Escape: 対話による視覚言語ナビゲーションの閉ループ化視覚言語ナビゲーション2026/9/23
ナビゲーションエージェントの迷走を検知したら対話で修正指示を求める仕組みを提案し、シミュレータと実機で成功率と頑健性を向上させた。
- VLM-MPPI: 自然言語を多様な飛行行動に接地する空中ナビゲーションVLA2026/9/16
自然言語の指示を6つの行動条件付きMPPIプランナで生成した多様な軌道候補に結びつけ、VLMがFPV画像から候補を選ぶ階層型UAVナビゲーションを実機とシミュレーションで実証した。
- 具現化エージェントが制御を握る:視覚言語ナビゲーションにおける最小インターフェースのゼロショットエージェントが産業規模ポリシーに匹敵ナビゲーション2026/7/1
汎用エージェントが単眼RGBカメラと離散行動のみでゼロショットナビゲーションを実行し、訓練済みポリシーなしで高い成功率を達成できることを示した。
- 報酬が見合うときだけ質問する:コストを考慮したオープンエンド対話によるインスタンス目標ナビゲーションナビゲーション2026/6/2
インスタンス目標ナビゲーションにおいて、曖昧な指示を解決するためのオラクルへの質問コストを考慮し、情報利得に基づいて質問タイプと重みを学習し、効率的な対話ナビゲーションを実現する手法を提案した論文。
- SpatialAnt: 能動的なシーン再構築と視覚的予測による自律ゼロショットロボットナビゲーションナビゲーション2026/3/1
ロボットが未知環境を事前探索して自己構築した不完全な3D再構築を用いて、ゼロショットで言語指示によるナビゲーションを実現するフレームワークを提案した。物理的接地によるスケール回復と視覚的予測による経路の反実仮想推論で性能を向上させた。
- 万物を導く一つのエージェント:明示的な世界表現によるMLLMの視覚言語ナビゲーション強化VLA2026/2/1
MLLMを用いたナビゲーションで、低レベル空間推定と高レベル意味計画を分離し、インタラクティブな計量世界表現と反事実推論を導入することで、ゼロショットで最先端性能を達成し、実機移行も実証した。
- VLNVerse:多様・身体性・リアルなシミュレーションと評価を備えた視覚言語ナビゲーションのベンチマークVLN2025/12/1
視覚言語ナビゲーション(VLN)の既存ベンチマークの限界を克服するため、多様なタスクを統合し、物理エンジンによる身体性とリアルなシミュレーションを実現した大規模ベンチマークVLNVerseを提案し、既存手法の評価と統合マルチタスクモデルを提示した。
- Fast-SmartWay: パノラマ不要のエンドツーエンドゼロショット視覚言語ナビゲーションVLA2025/11/1
正面のRGB-D画像3枚と言語指示のみからMLLMが直接行動を予測するゼロショットVLN-CEフレームワークを提案し、パノラマ観測とウェイポイント予測器を排除して遅延を大幅に削減した。
- 分離型アクションエキスパート:タスク知識を条件付け経路に閉じ込めるVLA2025/11/1
拡散ポリシーの行動生成バックボーンはタスク非依存にできることを示し、条件付け経路のみを学習させる分離型学習法を提案。244MのU-Netを5MのMLPに置き換えても同等以上の性能を達成した。
- BadNAVer: 視覚言語ナビゲーションに対するジェイルブレイク攻撃の探索VLA2025/5/1
MLLM駆動の視覚言語ナビゲータに対する初の体系的なジェイルブレイク攻撃を提案し、シミュレータと実機で90%超の攻撃成功率を示した。
- SmartWay: ゼロショット視覚言語ナビゲーションのためのウェイポイント予測とバックトラッキングの強化VLA2025/3/1
連続環境での視覚言語ナビゲーションにおいて、改良されたウェイポイント予測器とMLLMベースのナビゲータを組み合わせ、履歴推論とバックトラッキングを可能にしたゼロショットフレームワークを提案。
- 連続環境における地上視点の視覚と言語によるナビゲーションVLA2025/2/1
低視点の四足ロボット向けに、重み付き履歴観測と接続グラフ転移を用いて視覚と言語によるナビゲーションの汎化性能を高めるGVNavを提案した論文。
- Open-Nav: オープンソースLLMによる連続環境でのゼロショット視覚言語ナビゲーションの探求VLA2024/9/1
オープンソースLLMを使い、連続環境でのゼロショット視覚言語ナビゲーションを実現するOpen-Navを提案。時空間Chain-of-Thought推論と詳細な物体・空間知識でシーン認識を強化し、閉源LLMに匹敵する性能を示した。