日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ナビゲーションarXiv:2608.03244

UniNav: 視覚ナビゲーションのための統合ワールド・アクション拡散モデル

UniNav: A Unified World-Action Diffusion Model for Visual Navigation

シェア:XThreadsFacebookLINEはてブBluesky

画像ゴールの視覚ナビゲーションにおいて、将来の観測予測と軌道生成を単一の拡散プロセスで統合したモデルUniNavを提案。幾何認識カメラトークンとビデオのみのデータ学習により性能を向上させ、高速推論も可能にした。

詳しい要約

1. どんなもの?

UniNavは、画像ゴール視覚ナビゲーションのための統一されたworld-actionモデルである。単一の拡散プロセスを通じて、将来の視覚観測と連続ウェイポイント軌道の両方を生成する。履歴フレームとゴール画像が与えられると、単一のTransformer内で視覚トークンとウェイポイントトークンを共同でノイズ除去し、将来予測と行動生成を共有フレームワークで統合する。

2. 先行研究と比べてどこがすごい?

既存のナビゲーションポリシーはウェイポイント軌道を効率的に予測するが視覚的予見を欠き、ナビゲーションワールドモデルは将来の観測を予測できるがコストのかかるプランニングロールアウトを必要とすることが多い。UniNavは単一の拡散プロセスで両方を統合し、さらに軌道ラベル付きデータとビデオのみのデータの両方で訓練することで、ウェイポイントアノテーションなしの多様なビデオから学習できる点が新しい。

3. 技術・手法の肝は?

手法の肝は、視覚トークンとウェイポイントトークンを単一のTransformer内で共同でノイズ除去する統合拡散フレームワークである。空間的接地を改善するために幾何学を考慮したカメラトークンを組み込む。また、軌道ラベル付きナビゲーションデータとビデオのみのデータの両方で訓練する。さらに、UniNav-Fullは将来の観測と軌道を共同予測し、UniNav-Fastは推論時に将来画像トークンを除去して効率的な軌道予測を行う。

4. どうやって有効だと検証した?

ナビゲーションベンチマークでの実験により、UniNavがすべてのデータセットで最強のベースラインをATE(平均軌道誤差)で上回ることを示した。また、UniNav-Fastは1ステップ推論で0.1秒のレイテンシを達成し、精度の大幅な低下なしで動作することを検証した。

5. 議論はある?

要旨からは、UniNav-Fastが将来画像トークンを除去することで解釈可能性が低下する可能性や、ビデオのみのデータの活用方法の詳細、計算コストと精度のトレードオフに関する議論は不明である。また、実世界のロボットへの適用や一般化に関する議論も要旨には含まれていない。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、画像ゴール視覚ナビゲーションのための既存のナビゲーションポリシーとナビゲーションワールドモデルが挙げられる。具体的には、ウェイポイント予測を行うポリシーや、将来観測を予測するワールドモデルに関する論文が関連する。また、拡散モデルを用いた行動生成や視覚予測の研究も関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Changqing Zhou, Yueru Luo, Zeyu Jiang, Changhao Chen

分類: cs.AI

原文アブストラクト

Image-goal visual navigation is a fundamental capability for embodied agents. Existing navigation policies efficiently predict waypoint trajectories but lack visual foresight, while navigation world models can anticipate future observations but often require costly planning rollouts. We present UniNav, a unified world-action model that generates future visual observations and continuous waypoint trajectories through a single diffusion process. Given history frames and a goal image, UniNav jointly denoises visual and waypoint tokens within a single transformer, unifying future prediction and action generation in a shared framework. To improve spatial grounding, we incorporate geometry-aware camera tokens. We also train on both trajectory-labeled navigation data and video-only data, enabling the model to benefit from diverse videos without waypoint annotations. Based on this unified framework, we introduce two variants: UniNav-Full jointly predicts interpretable future observations and their corresponding trajectories, while UniNav-Fast removes future-image tokens at inference for efficient trajectory prediction. Experiments on navigation benchmarks show that UniNav outperforms the strongest baseline in ATE across all datasets. With one-step inference, UniNav-Fast achieves a latency of 0.1s without a substantial accuracy drop. Code will be released.

関連論文