日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ナビゲーションarXiv:2608.09073v1

単調計画コストを持つ潜在世界モデルによる画像目標ナビゲーション

Latent World Models with Monotone Planning Costs for Image-Goal Navigation

シェア:XThreadsFacebookLINEはてブBluesky

画像目標ナビゲーションのための潜在世界モデルにおいて、計画コストの順序性を改善する新しい損失関数を提案し、既存手法を上回る性能を達成した。

詳しい要約

1. どんなもの?

本論文は、画像ゴールナビゲーション(image-goal navigation)のための潜在世界モデル(latent world model)を提案する。プランニングコストとして、予測未来埋め込みとゴール埋め込みのコサイン距離を用いるが、その順序付けが不正確だとCross-Entropy Method (CEM)などのサンプリングベースのプランナーを誤らせることを示す。これを解決するため、凍結したDINO-familyエンコーダに基づく潜在世界モデルを構築し、自己回帰ロールアウト損失とMonotone Cost Ranking (MCR)損失の2つの相補的な目的で訓練する。GNMデータセットで最先端性能を達成し、実ロボットへのゼロショット展開も行う。

2. 先行研究と比べてどこがすごい?

既存のNavigation World Models (NWM)やDINO-WMなどの潜在世界モデルは、予測精度に焦点を当てるが、プランニングコストの順序付けの質を直接最適化していない。本手法は、MCR損失により、摂動されたアクションシーケンスがより高いコストを受けるように直接訓練することで、プランニング性能を向上させる。また、InfoNCEベースのアクション対比学習が時間的置換ネガティブにより潜在幾何学を歪め、性能を劣化させることを発見し、その問題を回避する。

3. 技術・手法の肝は?

手法の核は、(1)凍結したDINO-familyエンコーダを使用し、自己回帰ロールアウト損失で訓練することで、訓練とマルチステッププランニングのギャップを減らすこと。(2)Monotone Cost Ranking (MCR)損失を導入し、摂動レベルが増加するアクションシーケンスが単調に高いプランニングコストを受けるようにする。これにより、コスト関数の順序付けが改善され、CEMなどのプランナーがより良いアクションを選択できる。

4. どうやって有効だと検証した?

GNMナビゲーションデータセットで評価し、NWM、DINO-WM、OmniVLA、NoMaDと比較して、画像ゴールナビゲーション性能で最先端を達成。特に、同じエンコーダを使用するDINO-WMベースラインと比較して、方位誤差を2.7倍削減。さらに、実ロボットにゼロショット展開し、未見の屋内・屋外環境でゴール指向の経路を追従できることを示した。

5. 議論はある?

要旨からは、InfoNCEベースのアクション対比訓練が時間的置換ネガティブにより潜在幾何学を歪め、性能を劣化させることが議論されている。また、MCR損失の有効性が示される一方で、その理論的保証や他のプランナーへの適用可能性については不明。さらに、凍結エンコーダの選択や、異なるデータセットでの汎化性についての議論は要旨からは不明。

6. 次に読むべき論文は?

要旨で参照されている研究として、Navigation World Models (NWM)、DINO-WM、OmniVLA、NoMaDが挙げられる。また、関連手法として、潜在世界モデルやプランニングコスト学習に関する研究(例:Dreamer、TD-MPCなど)が考えられるが、要旨に明示されていないため、具体的な論文名は不明。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Amirhosein Chahe, Siwei Cai, Lifeng Zhou

分類: cs.RO

原文アブストラクト

Image-goal navigation with latent world models requires not only accurate future prediction, but also a planning cost that reliably ranks candidate action sequences. We define the cost as the cosine distance between the predicted future embedding and the goal embedding, and show that poor cost ordering can mislead sampling-based planners such as Cross-Entropy Method (CEM). To address this, we propose a latent world model built on a frozen DINO-family encoder and train it with two complementary objectives. An autoregressive rollout loss reduces the gap between training and multi-step planning rollouts, while a Monotone Cost Ranking (MCR) loss directly encourages increasingly perturbed action sequences to receive higher planning costs. We also study InfoNCE-based action-contrastive training and find that temporal permutation negatives distort the latent geometry and degrade planning performance. On the GNM navigation dataset, our method outperforms Navigation World Models (NWM), DINO-WM, OmniVLA, and NoMaD, achieving state-of-the-art image-goal navigation performance while reducing orientation error by $2.7\times$ over the same-encoder DINO WM baseline. We also deploy the model zero-shot on a physical robot, where it follows goal-directed paths in unseen indoor and outdoor environments.