日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ナビゲーションarXiv:2609.24189

オープンボキャブラリ・インスタンスナビゲーションのための物体-経路グラフによるトポロジカル表現

A Topological Representation with Object-Path Graphs for Open-Vocabulary Instance Navigation

シェア:XThreadsFacebookLINEはてブBluesky

物体と経路を統合したグラフ表現を提案し、密な地図構築なしにオープンボキャブラリな意味推論とトポロジカルナビゲーションを実現した。

詳しい要約

1. どんなもの?

- 視覚言語ナビゲーション(Vision-language navigation)のための新しい表現手法を提案。 - 物体と経路を統合した「object-path graph」を構築し、open-vocabularyな意味推論とトポロジカルナビゲーションを単一の軽量フレームワークで実現。 - このグラフ上で、意味的グラウンディング、グラフベースの自己位置推定、ナビゲーションを同時にサポート。 - 密なメトリックマップに依存せず、グラフ上を直接ナビゲートする戦略を導入。

2. 先行研究と比べてどこがすごい?

- 既存手法は、逐次的な言語ガイド付き意思決定に分解するか、事前環境知識なしのオンライン探索に依存。 - シーングラフ表現はコンパクトな意味記憶を提供するが、下流のナビゲーションとは切り離され、依然として密なメトリックマップに依存。 - 提案手法は、このギャップを埋め、open-vocabularyな意味推論とトポロジカルナビゲーションを統合。 - 密なメトリック再構成を必要とせず、グラフ上で直接ナビゲーションを可能にする点が優れている。

3. 技術・手法の肝は?

- 物体と経路を統合した「object-path graph」を構築。 - このグラフは、意味的グラウンディング、グラフベースの自己位置推定、ナビゲーションを単一の軽量トポロジカルフレームワークで共同サポート。 - ナビゲーション戦略は、グローバル経路計画とローカルなノード間実行を組み合わせる。 - ローカル実行には、軽量なノード自己位置推定と意味的ビジュアルサーボ(semantic visual servoing)を使用。 - これにより、密なメトリック再構成なしでグラフ上を直接ナビゲート可能。

4. どうやって有効だと検証した?

- HM3DとReplicaデータセットでの実験を実施。 - 提案する階層的グラフ構造を通じて、open-vocabulary物体グラウンディングにおいて競争力のある性能を達成。 - 同時に効果的なナビゲーション性能を実現。 - 実世界のロボット実験により、フレームワークの実用性をさらに検証。

5. 議論はある?

- 要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究は明示されていない。 - 関連手法として、Vision-language navigation、Scene graph representations、Open-vocabulary object grounding、Topological navigation、Semantic visual servoing などが挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Linwei Zheng, Daojie Peng, Bingtao Wang, Haoang Li, Jun Ma

分類: cs.RO

原文アブストラクト

Vision-language navigation requires embodied agents to navigate environments using natural language instructions and visual observations. Existing approaches typically decompose navigation into sequential language-guided decisions or rely on online exploration without prior environmental knowledge. Scene graph representations offer compact semantic memory but remain decoupled from downstream navigation, which still depends on dense metric maps. To close this gap, we propose an object--path graph that unifies open-vocabulary semantic reasoning with topological navigation. The proposed representation jointly supports semantic grounding, graph-based localization, and navigation within a single lightweight topological framework. Building on this graph, we introduce a navigation strategy that combines global path planning with local inter-node execution through lightweight node localization and semantic visual servoing, enabling navigation directly over the graph without dense metric reconstruction. Experiments on HM3D and Replica demonstrate competitive performance in open-vocabulary object grounding through the proposed hierarchical graph structure, while achieving effective navigation performance. Real-world robot experiments further validate the practicality of the proposed framework.

関連論文

PR本紙発行元 EmplifAI