日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ナビゲーションarXiv:2608.16476v1

実世界動画からのスケーラブル学習による都市ナビゲーションのロングテール顕在化

Exposing the Long-tail in Embodied Urban Navigation via Scalable Learning from In-the-Wild Videos

シェア:XThreadsFacebookLINEはてブBluesky

ウェブ上の未編集な一人称視点動画からメトリック軌跡とナビゲーション意味情報を自動アノテーションし、視覚言語行動ポリシーを訓練して都市ナビゲーションのロングテールな稀なシナリオを体系的に明らかにする枠組みを提案した。

詳しい要約

1. どんなもの?

本論文は、実世界の都市ナビゲーションポリシーを学習する際の課題(タスク固有データ収集のコストと、稀だが安全上重要なシナリオのカバレッジ不足)に対処するため、ウェブ規模の非構造化エゴセントリックビデオからポイントゴール都市ナビゲーションを学習するスケーラブルなフレームワークを提案する。このフレームワークは、未キュレーションのウェブビデオにメトリック軌跡と構造化ナビゲーションセマンティクスを自動アノテーションし、解釈可能なナビゲーションプランニングのためのvision-language-actionポリシーを訓練する。さらに、モデル性能と知覚-運動パターンの分布に基づいてロングテールを特徴付け、反射ベースの分析を用いて再発する失敗モードを診断する。

2. 先行研究と比べてどこがすごい?

先行研究では、実世界データからのナビゲーション学習はタスク固有データ収集のコストと稀なシナリオのカバレッジ不足に制約されていた。本手法は、ウェブ規模の非構造化ビデオを活用することで、タスク固有データ収集のコストを回避し、ロングテールを体系的に露出させる点が新しい。また、自動アノテーションにより大規模データを活用し、vision-language-actionポリシーによる解釈可能なプランニングを実現している点が先行研究と異なる。

3. 技術・手法の肝は?

技術の肝は、未キュレーションのウェブビデオにメトリック軌跡と構造化ナビゲーションセマンティクスを自動アノテーションするパイプラインと、それを使って訓練するvision-language-actionポリシーにある。さらに、モデル性能と知覚-運動パターンの分布に基づいてロングテールを特徴付け、反射ベースの分析で失敗モードを診断する手法も含まれる。

4. どうやって有効だと検証した?

ウェブビデオデータと実世界の都市ナビゲーションタスクの実験により、非制約ビデオからの知識転移の有効性を示し、総合ナビゲーション性能を超えた一貫したロングテール構造を明らかにした。

5. 議論はある?

要旨からは、ロングテールの露出が安全上重要である一方、その構造がどのようにポリシー改善に活用されるかは不明。また、自動アノテーションの精度や、ウェブビデオと実世界のドメインギャップについての議論は要旨に含まれていない。

6. 次に読むべき論文は?

要旨で参照されている関連研究は明示されていないが、同分野の定番として、エゴセントリックビデオからのナビゲーション学習(例:Ego4D)、vision-language-actionモデル、ロングテール認識に関する研究が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Bingyi Xia, Han Bao, Zhewei Chen, Hanjing Ye, Jingwen Yu, Yuhan Pang, Wenjun Xu, Jiankun Wang

分類: cs.RO

原文アブストラクト

Learning embodied urban navigation policies from real-world data is constrained by the cost of task-specific data collection and the limited coverage of rare yet safety-critical scenarios. To address these challenges, we present a scalable framework for learning point-goal urban navigation from web-scale in-the-wild egocentric videos while systematically exposing its long tail. The framework automatically annotates uncurated web videos with metric trajectories and structured navigation semantics, which are then used to train a vision-language-action policy for interpretable navigation planning. We characterize the long tail based on model performance and the distribution of perception-motion patterns, and employ reflection-based analysis to diagnose recurring failure modes. Experiments on web-video data and real-world urban navigation tasks demonstrate effective knowledge transfer from unconstrained videos and reveal coherent long-tail structures beyond aggregate navigation performance.