日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ナビゲーションarXiv:2609.27526

NavProbe: 能動的記憶検索による証拠に基づく推論を用いたゼロショットナビゲーション

NavProbe: Evidence-Grounded Reasoning with Active Memory Retrieval for Zero-Shot Navigation

シェア:XThreadsFacebookLINEはてブBluesky

訪問場所や遷移の要約をインデックス化し、必要時に視覚・幾何情報を能動的に検索してサブゴールを修正する階層型ゼロショットナビゲーション手法を提案し、R2R-CEやRxR-CEで高い性能を示した。

詳しい要約

1. どんなもの?

- 長期的なナビゲーションタスクを対象とした階層型ゼロショットナビゲーションエージェント「NavProbe」を提案。 - 動的なサブゴールアジェンダと能動的な証拠検索を組み合わせる。 - 訪問場所・遷移・ランドマークの要約を視覚・幾何記録にリンクするコンパクトなインデックスを構築。 - 現在の文脈が不十分な場合、タスクエグゼクティブが対象を絞った証拠を検索し、サブゴールの生成・修正・解決を行う。 - 再利用可能な結論でインデックスを更新し、スキルポリシーが修正されたタスク状態をパラメータ化されたナビゲーション行動に変換する。

2. 先行研究と比べてどこがすごい?

- 完全な視覚履歴は処理コストが高く、コンパクトな要約は以前の決定を再検討するのに必要な詳細を欠く可能性があるという課題に対処。 - ゼロショット設定で、R2R-CEで71.7% SR・55.8% SPL、RxR-CEで55.3% SR・38.6% SPLを達成し、強力なゼロショットベースラインを上回る。 - HM3D-v2 ObjectNavで79.3% SRを達成。 - 実ロボット実証により物理展開可能性を示す。

3. 技術・手法の肝は?

- 動的なサブゴールアジェンダと能動的証拠検索を結合した階層型ゼロショットナビゲーション。 - コンパクトインデックスが訪問場所・遷移・ランドマークの要約を視覚・幾何記録にリンク。 - タスクエグゼクティブが現在の文脈不足時に的を絞った証拠を検索し、サブゴールを生成・修正・解決。 - 再利用可能な結論でインデックスを更新。 - スキルポリシーが修正タスク状態をパラメータ化ナビゲーション行動に変換。

4. どうやって有効だと検証した?

- R2R-CE、RxR-CE、HM3D-v2 ObjectNavのベンチマークで評価。 - R2R-CEで71.7% SR、55.8% SPL、RxR-CEで55.3% SR、38.6% SPL、HM3D-v2 ObjectNavで79.3% SRを達成。 - 強力なゼロショットベースラインと比較。 - 定性的な実ロボット実証を実施。

5. 議論はある?

- 要旨からは不明。

6. 次に読むべき論文は?

- R2R-CE、RxR-CE、HM3D-v2 ObjectNavのベンチマーク。 - ゼロショットナビゲーションの強力なベースライン(具体的名称は要旨に記載なし)。 - 同分野の定番としてVision-and-Language Navigation(VLN)関連手法。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Jingyang Liu, Sujia Yao, Jiayuan Gu, Lan Xu

分類: cs.RO

原文アブストラクト

Long-horizon navigation requires an agent to revise its intermediate objectives as evidence accumulates. Full visual histories are costly to process, while compact summaries may omit details needed to reconsider earlier decisions. We introduce NavProbe, a hierarchical zero-shot navigation agent that couples a dynamic subgoal agenda with active evidence retrieval. A compact index links summaries of visited places, transitions, and landmarks to their visual and geometric records. When the current context is insufficient, a task executive retrieves targeted evidence to generate, revise, or resolve subgoals. Reusable conclusions are used to update the index, and a skill policy converts the revised task state into parameterized navigation actions. NavProbe achieves 71.7% SR and 55.8% SPL on R2R-CE and 55.3% SR and 38.6% SPL on RxR-CE, outperforming strong zero-shot baselines. It also achieves 79.3% SR on HM3D-v2 ObjectNav, with qualitative real-robot demonstrations illustrating physical deployment.

関連論文

PR本紙発行元 EmplifAI