日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ナビゲーションarXiv:2608.10817v1

AECNav: 効率的なゼロショットオープンボキャブラリ物体ナビゲーションのための能動的証拠統合

AECNav: Active Evidence Consolidation for Efficient Zero-Shot Open-Vocabulary Object Navigation

シェア:XThreadsFacebookLINEはてブBluesky

ゼロショット物体ナビゲーションを証拠駆動の知覚・意思決定問題として再構成し、共有エンコーディングとクラスタレベルの信念統合、情報利得に基づく能動的探索により、高精度かつ低遅延なナビゲーションを実現した。

詳しい要約

1. どんなもの?

AECNavは、ゼロショット物体目標ナビゲーション(ZSON)を証拠駆動の知覚-意思決定問題として再構成した、トレーニング不要のパイプラインである。3つのコンポーネントから構成される: i) 証拠ゲート知覚(Evidence-gated perception)は、全推論段階で共有エンコーディングを用いて統一された意味的基盤を確立し、冗長な計算を排除する。ii) 証拠統合(Evidence consolidation)は、検出結果をクラスタレベルの対数オッズ信念に集約し、真の目標支持と視覚的に類似する妨害物による誤信頼を明示的に分離し、期待される検出の欠如を否定的証拠として扱う。iii) 能動的証拠獲得(Active evidence acquisition)は、弱い意味的手がかりの下で、情報利得を最大化し移動コストを最小化するフロンティアを選択することで、生産的な探索を維持する。

2. 先行研究と比べてどこがすごい?

従来のZSON手法は、冗長な知覚パイプラインによる高レイテンシと、信頼できる目標確認のための証拠不足による精度限界に悩まされていた。AECNavは、共有エンコーディングによる計算削減と、クラスタレベルの対数オッズ信念による証拠統合、さらに否定的証拠の活用により、精度と効率を両立し、HM3D-v2、HM3D-OVON、MP3Dで最先端の成功率を達成した。また、物理ロボットでの実証も行い、実世界での有効性を示した。

3. 技術・手法の肝は?

手法の核心は、証拠駆動の知覚-意思決定フレームワークにある。具体的には、i) 共有エンコーディングにより、物体検出、セマンティックセグメンテーション、シーン理解などの推論段階で同じ特徴表現を使用し、冗長な計算を排除する。ii) 検出結果をクラスタリングし、各クラスタの対数オッズ信念を更新することで、真の目標物体からの支持と、視覚的に類似する妨害物からの誤った信頼を分離する。また、期待される物体が検出されない場合を否定的証拠として扱い、信念を更新する。iii) 探索時には、情報利得と移動コストのトレードオフを考慮したフロンティア選択を行い、弱い意味的手がかりの下でも効率的な探索を実現する。

4. どうやって有効だと検証した?

シミュレーション環境HM3D-v2、HM3D-OVON、MP3Dで評価し、成功率84.7%、57.3%、51.3%を達成し、従来手法を大幅に上回った。また、推論オーバーヘッドを大幅に削減した。さらに、物理的な四足ロボットを用いて40回の試行で95%の成功率を達成し、約5Hzの動作周波数を実証した。

5. 議論はある?

要旨からは、議論の詳細は不明である。ただし、提案手法はトレーニング不要であり、汎用性が高い一方で、共有エンコーディングの品質やクラスタリングのパラメータ設定に依存する可能性がある。また、物理ロボットでの実験は40試行と限定的であり、より多様な環境での検証が望まれる。

6. 次に読むべき論文は?

要旨で参照されている先行研究や関連手法は明示されていないが、ZSONの分野では、オープンボキャブラリ物体検出(例えば、CLIPやGrounding DINO)や、物体目標ナビゲーションのための強化学習手法(例えば、Semantic Exploration)が関連する。また、情報利得に基づく探索手法(例えば、Frontier-based Exploration)も関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Guanlin Liu, Shaobin Ling, Renyuan Liu, Zeying Gong, Junjie Hu

分類: cs.RO

原文アブストラクト

Zero-shot object-goal navigation (ZSON) in open-vocabulary scenarios is challenging, as it requires a robot to locate an arbitrarily specified object in an unseen environment without task-specific training. Currently, the task still suffers from high latency and limited accuracy due to redundant perception pipelines and insufficient evidence for reliable target confirmation. In this letter, we reframe ZSON as an evidence-driven perception-to-decision problem and present AECNav, a training-free pipeline built on three components: i) Evidence-gated perception, which utilizes a shared encoding across all reasoning stages to establish a unified semantic basis and eliminate redundant computations; ii) Evidence consolidation, which aggregates detections into cluster-level log-odds beliefs. This explicitly separates genuine target support from the false confidence of visually similar distractors, while treating the absence of expected detections as negative evidence; and iii) Active evidence acquisition, which sustains productive exploration under weak semantic cues by selecting frontiers that maximize information gain at minimal traversal cost. As a result, AECNav significantly outperforms previous methods and achieves state-of-the-art success rates of 84.7%, 57.3%, and 51.3% on HM3D-v2, HM3D-OVON, and MP3D, respectively, with substantially lower inference overhead, and attains 95% success across 40 trials on a physical quadruped robot at roughly 5Hz. Code will be made publicly available upon acceptance.