日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2609.30770

NavGen: 視覚生成モデルを身体性3Dナビゲーションのスケーラブルなデータエンジンとして活用

NavGen: Visual Generative Models as a Scalable Data Engine for Embodied 3D Navigation

シェア:XThreadsFacebookLINEはてブBluesky

テキストから動画を生成するモデルをデータエンジンとして使い、屋内・屋外の視覚言語ナビゲーション(VLN)エピソードを約40万件生成し、実世界のドローン飛行実験で75%の成功率を達成した。

詳しい要約

1. どんなもの?

- 本論文は、embodied 3D navigation のためのスケーラブルなデータエンジンとして、高忠実度 visual generative models を活用することを提案する。 - 具体的には、text-to-video データ生成パイプライン NavGen を導入し、屋内・屋外の多様な vision-language navigation (VLN) エピソードを生成する。 - さらに、収集が困難でコストのかかる long-tail データを拡張する style-diversification 手法を提案する。 - 生成されたデータセットは約 400K のナビゲーションエピソードを含む。

2. 先行研究と比べてどこがすごい?

- 既存のデータソースは、シミュレーションデータは大規模生成可能だが visual sim-to-real gap があり、実世界の flight データは現実的だが収集コストが高いというトレードオフに直面していた。 - 本研究は、visual generative models をデータエンジンとして用いることで、このトレードオフを回避し、大規模かつ多様なデータを生成できる可能性を示す。 - 既存の UAV navigation データセットと比較して、提案データセットで訓練したモデルはスケールとともに性能が向上し、既存データセットで訓練したモデルを上回った。

3. 技術・手法の肝は?

- 高忠実度 visual generative models を用いた text-to-video データ生成パイプライン NavGen を構築。 - これにより、屋内・屋外の多様な VLN エピソードを生成する。 - また、style-diversification 手法を提案し、収集が困難な long-tail データを拡張する。 - 生成データセットは約 400K エピソードからなる。

4. どうやって有効だと検証した?

- 提案データセットを既存の UAV navigation データセットと複数の指標で比較評価。 - 提案データで訓練したモデルがスケールとともに一般に性能向上し、既存データセットで訓練したモデルを上回ることを確認。 - 実世界への転移性を検証するため、訓練モデルを world-action-model パラダイムで実世界の飛行実験に展開。 - 最終モデルは異なるナビゲーションタスクと環境で 75% の成功率を達成。

5. 議論はある?

- 要旨からは、提案手法の限界や失敗事例、計算コスト、生成データの品質に関する議論は明示されていない。 - 実世界転移の成功例は示されているが、sim-to-real gap の残存や long-tail データの偏りなどについての議論は要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究として、既存の UAV navigation データセット(具体的名称は要旨に記載なし)が挙げられる。 - 関連手法として、vision-language navigation (VLN)、text-to-video 生成モデル、world-action-model パラダイムが挙げられる。 - 同分野の定番として、embodied 3D navigation における sim-to-real 転移やデータ拡張に関する研究が次に読むべき候補となる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Xijie Huang, Yongyang Wan, Chengbin Dong, Zimo Ding, Mo Zhu, Yijin Wang, Zhiyang Liu, Fei Gao, Yuze Wu, Xin Zhou

分類: cs.RO, cs.AI

原文アブストラクト

General-purpose robot models increasingly rely on large and diverse datasets. For embodied 3D navigation, however, existing data sources face a fundamental trade-off: simulated data can be generated at scale but often suffer from the visual sim-to-real gap, whereas real-world flight data provide realistic observations but are costly to collect. This paper studies another direction: the use of high-fidelity visual generative models as scalable data engines for embodied 3D navigation. We introduce NavGen, a text-to-video data generation pipeline that produces diverse vision-language navigation (VLN) episodes across indoor and outdoor scenes. We also propose a style-diversification method that scales up long-tail data that are difficult and costly to collect. The resulting dataset contains approximately 400K navigation episodes. We evaluate our dataset against existing UAV navigation datasets across multiple metrics, and find that the model trained on our data generally improves with scale, outperforming those trained on existing datasets. To validate real-world transferability, we deploy the trained model in world-action-model paradigm to real-world flying experiments. The final model achieves a 75\% success rate across different navigation tasks and environments.

関連論文

PR本紙発行元 EmplifAI