日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ナビゲーションarXiv:2608.12707v1

SAP-Nav: 空間意味表現と能動的知覚を統合した階層的オープン語彙物体ナビゲーション

SAP-Nav: Spatial Semantic Representation Meets Active Perception for Hierarchical Open-Vocabulary Object Navigation

シェア:XThreadsFacebookLINEはてブBluesky

未知環境での階層的オープン語彙物体ナビゲーションを、能動的視点選択と空間意味表現の構築により解決するゼロショットフレームワークを提案した。

詳しい要約

1. どんなもの?

SAP-Navは、階層的オープンボキャブラリ物体ナビゲーション(hierarchical OVON)のための、完全オンラインでゼロショットのフレームワークである。エージェントは、シーン、部屋、領域、インスタンスレベルの手がかりを含む自由形式の指示に従い、未知環境を探索する。SAP-Navは、能動的に取得した部屋のビューからQueryable Spatial-Semantic Representationを段階的に構築し、任意の探索位置から空間意味クエリを可能にする。さらに、Active Viewpoint Verificationを用いて、現在の観測が十分な証拠を提供するか評価し、必要に応じてより情報量の多い視点にエージェントを再配置してから、カテゴリと属性の制約に基づいて候補を検証する。階層的OVONと標準的なカテゴリレベルOVONの両方をサポートし、タスク固有のトレーニングや事前計算されたシーンマップを必要としない。

2. 先行研究と比べてどこがすごい?

先行研究のLangMapが階層的OVONを形式化したが、部分観測下での解決は困難であり、空間的接地には環境レベルの持続的な証拠が必要で、ターゲット検証には明確で識別可能な候補ビューが必要である。SAP-Navは、能動的知覚(active perception)を通じてこれらの要件に対処する点が新しい。具体的には、能動的に取得した部屋のビューから空間意味表現を構築し、任意の場所からクエリ可能にすることで、環境レベルの証拠を蓄積する。また、Active Viewpoint Verificationにより、現在の観測が十分か判断し、不十分ならより情報量の多い視点に移動してから検証する。これにより、トレーニングベースの手法を上回る性能を達成し、特に領域レベルのナビゲーションでSRを12.2%向上させた。

3. 技術・手法の肝は?

手法の肝は、能動的知覚に基づく2つの主要コンポーネントである。第一に、Queryable Spatial-Semantic Representationを段階的に構築する。エージェントは部屋のビューを能動的に取得し、それらを統合して空間意味表現を構築する。この表現は、任意の探索位置から空間意味クエリを可能にし、環境レベルの証拠を提供する。第二に、Active Viewpoint Verificationを採用する。エージェントは現在の観測が候補検証に十分な証拠を提供するか評価し、不十分な場合はより情報量の多い視点に再配置する。これにより、カテゴリと属性の制約に基づく候補検証の信頼性が向上する。全体として、タスク固有のトレーニングや事前計算されたシーンマップを必要とせず、完全オンラインで動作する。

4. どうやって有効だと検証した?

実験は、LangMapとHM3D-OVONのベンチマークで実施された。SAP-Navは、階層的および標準的なカテゴリレベルOVONの両方で、全体的に最高の性能を達成した。特に、領域レベルのナビゲーションでは、トレーニングベースの手法と比較してSR(成功率)を12.2%向上させた。さらに、実世界のロボット実験でも実用可能性が実証された。

5. 議論はある?

要旨からは、議論の詳細は不明である。ただし、SAP-Navは完全オンラインでゼロショットであるため、トレーニングベースの手法と比較して一般化の利点があると考えられる。また、能動的知覚により部分観測下での性能が向上するが、計算コストや探索効率のトレードオフが存在する可能性がある。実世界実験では実用可能性が示されたが、大規模環境や動的環境での性能は要旨からは不明である。

6. 次に読むべき論文は?

要旨で参照されている研究はLangMapであり、これは階層的OVONを形式化した先行研究である。また、HM3D-OVONはベンチマークとして使用されている。次に読むべき論文としては、LangMapの論文(階層的OVONの定式化)や、オープンボキャブラリ物体ナビゲーションの基礎となる手法(例えば、CLIPを用いたナビゲーション)が考えられる。具体的には、LangMapの論文と、HM3Dデータセットに関する論文が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Xuetong Pei, Jian Liu, Vidura Munasinghe, Bo Miao, U-Xuan Tan, Wenrui Ding, Na Zhao

分類: cs.RO

原文アブストラクト

Hierarchical open-vocabulary object navigation (OVON) requires agents to follow free-form instructions that may specify targets through scene-, room-, region-, and instance-level cues in unseen environments. Although recent work LangMap has formalized this setting, reliably solving it under partial observations remains challenging: spatial grounding requires persistent environment-level evidence, whereas target verification requires clear and discriminative candidate views. We present SAP-Nav, a fully online, zero-shot framework that addresses both requirements through active perception. SAP-Nav incrementally constructs a Queryable Spatial-Semantic Representation from actively acquired room views, enabling spatial semantic queries from any explored location. It further employs Active Viewpoint Verification to assess whether the current observation provides sufficient evidence and, when necessary, reposition the agent to a more informative viewpoint before verifying candidates against category and attribute constraints. Although designed for hierarchical OVON, SAP-Nav supports both hierarchical and standard category-level OVON without task-specific training or precomputed scene maps. Experiments on LangMap and HM3D-OVON show that SAP-Nav achieves the overall best performance, including a 12.2% improvement in SR over training-based methods on region-level navigation. Real-world robot experiments further demonstrate its practical feasibility. Code will be made publicly available upon acceptance.