日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2610.10421

AirGroundVLN:目標指向の空地協調視覚言語ナビゲーションのための大規模ベンチマーク

AirGroundVLN: A Large-Scale Benchmark for Goal-Oriented Air-Ground Collaborative Vision-and-Language Navigation

シェア:XThreadsFacebookLINEはてブBluesky

空地協調の視覚言語ナビゲーションを体系的に評価するため、19のUnreal Engine環境で1万件超のエピソードを含む大規模ベンチマークAirGroundVLNと、時空間記憶と空中ガイド計画を組み合わせた参照手法AG-CoNAVを提案した。

詳しい要約

1. どんなもの?

- 目的志向のVision-and-Language Navigation (VLN) において、空中と地上の協調によるナビゲーションを体系的に研究するための大規模ベンチマーク「AirGroundVLN」を提案。 - 10,281のナビゲーションエピソードと955のターゲットインスタンスを含み、19のUnreal Engine環境で構成。 - seen/unseen分割とaerial-visibilityプロトコルを備え、系統的な評価を可能にする。 - 併せて、訓練可能な参照フレームワーク「AG-CoNAV」を提案。

2. 先行研究と比べてどこがすごい?

- 従来、目的志向の空中・地上協調VLNの系統的研究は、大規模で多様なベンチマークの欠如により限られていた。 - 本論文は、大規模ベンチマークAirGroundVLNを提供することで、この制限を克服。 - また、空中と地上の視点の大きな違いや時間経過に伴う観測の欠落、非対称な空間観測性という2つの課題に対処するAG-CoNAVを提案。 - 単一プラットフォームの計画の信頼性限界を克服する点が先行研究と比べて優れている。

3. 技術・手法の肝は?

- AG-CoNAVは、Spatiotemporally Anchored Collaborative Memory (SACM) と Aerial-Guided Regional-to-Local Planning (AGRLP) の2つの主要コンポーネントからなる。 - SACMは、空中と地上の観測にわたって空間的に一貫した履歴コンテキストを維持・検索する。 - AGRLPは、地域的な空中ガイダンスと細粒度の地上ナビゲーションを組み合わせる。 - これにより、非対称な空間観測性に対処し、信頼性の高い計画を実現。

4. どうやって有効だと検証した?

- 広範な実験により、AG-CoNAVの有効性を実証。 - AirGroundVLNを将来の探求のための包括的なベンチマークとして確立。 - 具体的な評価指標やベースラインとの比較詳細は要旨からは不明。

5. 議論はある?

- 空中と地上の視点の違いや時間経過に伴う観測の欠落、非対称な空間観測性という課題を指摘。 - これらの課題に対処するためのベンチマークとフレームワークを提案。 - 限界や今後の課題についての具体的な議論は要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究は明示されていない。 - 同分野の関連手法として、Vision-and-Language Navigation (VLN) やair-ground collaborationの既存研究が挙げられる。 - 具体的な論文名は要旨からは不明。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Zhenxuan Zeng, Qingle Wu, Wei Suo, Maojia Wu, Bairong Zhang, Hangzheng Yu, Peng Wang

分類: cs.RO

原文アブストラクト

Goal-oriented Vision-and-Language Navigation (VLN) requires agents to locate and reach targets described in natural language without prescribed routes. Air--ground collaboration is valuable for tasks requiring both wide-area search and fine-grained localization. However, systematic study of goal-oriented air--ground collaborative VLN remains limited by the lack of large-scale, diverse benchmarks and two core challenges: 1) substantial differences between aerial and ground views, together with useful observations becoming unavailable as navigation proceeds, make it difficult to maintain spatially consistent context across platforms and over time; and 2) asymmetric spatial observability makes ground perception locally detailed but spatially limited and aerial perception broad but locally coarse, limiting the reliability of single-platform planning. To address these limitations, we introduce AirGroundVLN, a benchmark containing 10,281 navigation episodes and 955 target instances across 19 Unreal Engine environments, with seen/unseen splits and an aerial-visibility protocol for systematic evaluation. Alongside the benchmark, we propose AG-CoNAV, a trainable reference framework comprising two key components: Spatiotemporally Anchored Collaborative Memory (SACM) and Aerial-Guided Regional-to-Local Planning (AGRLP). SACM maintains and retrieves spatially consistent historical context across aerial and ground observations. Meanwhile, AGRLP combines regional aerial guidance with fine-grained ground navigation. Extensive experiments demonstrate the effectiveness of AG-CoNAV and establish AirGroundVLN as a comprehensive benchmark for future exploration.

関連論文

PR本紙発行元 EmplifAI