日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2609.20388

Navi-Agent: 位置推定不要の単眼ナビゲーションエージェント

Navi-Agent: Unlocalized Monocular Navigation Agent

シェア:XThreadsFacebookLINEはてブBluesky

座標や幾何学的な自己位置推定を使わず、視覚観測と移動履歴からナビゲーション用トポロジーを構築し、ゼロショットで長期的な視覚言語ナビゲーションを実現するエージェントを提案した。

詳しい要約

1. どんなもの?

- どんなもの? - Navi-Agentは、zero-shot VLN-CE(Vision-Language Navigation in Continuous Environments)のためのエージェント。 - 連続環境で未知の環境における長期的な指示を実行する。 - 視覚観測と実行された運動履歴から座標フリーの空間状態を構築する。 - ナビゲーション・トポロジーとして状態を組織化し、ノードは視覚的な場所、エッジは運動遷移を表す。 - 観測ベースの近似自己位置推定、タスク進捗検証、視覚的再訪による回復を可能にする。 - 指示をサブゴールに分解し、ローカル視覚ナビゲーションを実行し、構築した空間状態を通じて訪問場所を検証する閉ループナビゲーションを行う。

2. 先行研究と比べてどこがすごい?

- 先行研究と比べてどこがすごい? - 既存のzero-shot VLN-CEシステムは通常、幾何学的ローカリゼーションや座標ベース表現で空間状態を維持する。 - 最近のgeometry-constrainedナビゲーションは深度とグローバルに一貫した座標を排除するが、場所確認、進捗検証、回復のための持続的な空間認識の維持が困難。 - Navi-Agentは座標フリーの空間状態を構築し、これらの課題に対処。 - zero-shot VLN-CEベンチマークと実世界ロボットプラットフォームでの実験で、geometry-constrained手法の中で最先端性能を達成し、幾何学的ローカリゼーションに依存するアプローチと競合可能。

3. 技術・手法の肝は?

- 技術や手法の肝はどこ? - 視覚観測と実行された運動履歴から座標フリーの空間状態を構築。 - ナビゲーション・トポロジーとして組織化:ノードは視覚的な場所、エッジは運動遷移。 - この表現により、観測ベースの近似自己位置推定、タスク進捗検証、視覚的再訪による回復が可能。 - 閉ループナビゲーション:指示をサブゴールに分解、ローカル視覚ナビゲーションを実行、構築した空間状態を通じて訪問場所を検証。

4. どうやって有効だと検証した?

- どうやって有効だと検証した? - zero-shot VLN-CEベンチマークでの実験。 - 実世界ロボットプラットフォームでの実験。 - 結果:geometry-constrained手法の中で最先端性能を達成し、幾何学的ローカリゼーションに依存するアプローチと競合可能。

5. 議論はある?

- 議論はある? - 要旨からは不明。

6. 次に読むべき論文は?

- 次に読むべき論文は? - 要旨で参照/比較されている研究:geometry-constrained navigation、zero-shot VLN-CE systems、geometric localization approaches。 - 関連手法:Vision-Language Navigation in Continuous Environments (VLN-CE)。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Wenyuan Xie, Mengyang Hong, Yongzhong Wang, Yanbiao Ji, Yijin Zhou, Shaokai Wu, Shalayiding Sirejiding, Huayi Zhou, Yi-Chao Chen, Ma Ling, Yue Ding, Hongtao Lu

分類: cs.RO, cs.CV

原文アブストラクト

Vision-Language Navigation in Continuous Environments (VLN-CE) requires an embodied agent to execute long-horizon instructions in unknown environments. Existing zero-shot VLN-CE systems typically maintain spatial states through geometric localization or coordinate-based representations. Recent geometry-constrained navigation removes depth and globally consistent coordinates, but maintaining persistent spatial awareness for place confirmation, progress verification, and recovery remains challenging. We present Navi-Agent, a zero-shot VLN-CE agent that constructs a coordinate-free spatial state from visual observations and executed motion histories. Navi-Agent organizes this state as a navigation topology, where nodes represent visual places and edges represent motion transitions. This representation enables observation-based approximate self-localization, task progress verification, and visual revisitation-based recovery. Navi-Agent performs closed-loop navigation by decomposing instructions into sub-goals, executing local visual navigation, and verifying visited places through the constructed spatial state. Experiments on zero-shot VLN-CE benchmark and real-world robot platforms show that Navi-Agent achieves state-of-the-art performance among geometry-constrained methods while remaining competitive with approaches relying on geometric localization.

関連論文

PR本紙発行元 EmplifAI