日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ナビゲーションarXiv:2610.12368

LiteNWM: 実環境でのオンボード視覚ナビゲーションのための効率的な潜在世界モデル

LiteNWM: Efficient Latent World Models for Onboard Visual Navigation in the Wild

シェア:XThreadsFacebookLINEはてブBluesky

複数の候補軌道の将来表現を共有エンコーダでまとめて予測し、学習済みスコアラで軌道選択する軽量な潜在世界モデルを提案。実機ナビゲーション成功率を43.3%から83.3%に改善した。

詳しい要約

1. どんなもの?

- オンボードの視覚ナビゲーション向けのlatent navigation world model「LiteNWM」を提案する研究。 - 複数候補のtrajectoryを生成するだけでなく、action-conditionedな将来表現を複数horizonで予測し、学習済みscorerで候補を選択する。 - 実ロボットのclosed-loopナビゲーションを対象とし、屋内・屋外の未見環境で評価している。

2. 先行研究と比べてどこがすごい?

- 直接的なvisual navigation policyは効率的だが将来の結果を明示的に評価しない。 - 生成的なnavigation world modelはvisual rolloutで将来を見通せるが、複数候補の評価コストが高い。 - LiteNWMは候補間でvisual encodingを共有し、複数horizonの将来表現をまとめて予測することで、この計算コストを削減する。 - オフライン評価でNoMaD+NWM-XL比でmacro-averaged trajectory errorを17.56%削減し、RTX 5090で128.00倍のend-to-end speedupを達成。

3. 技術・手法の肝は?

- latent navigation world modelとして、候補trajectory間でvisual encodingを共有する。 - action-conditionedな将来表現を複数のhorizonでjointlyに予測する。 - 学習済みscorerがこれらの予測を用いてtrajectoryを選択する。 - これによりvisual rolloutを候補ごとに繰り返すコストを避け、将来を考慮したplanningを可能にする。

4. どうやって有効だと検証した?

- オフライン評価をRECON、SCAND、SACSoNで実施。 - NoMaD+NWM-XLと比較し、macro-averaged trajectory errorを17.56%削減、RTX 5090で128.00倍のend-to-end speedupを確認。 - 同じevaluatorがNoMaDからMBRAへproposer-specific retrainingなしで転移し、MBRAのmacro-averaged trajectory errorを16.2%削減。 - 実ロボット実験を未見の屋内・屋外環境で行い、NoMaD比でナビゲーション成功率を43.3%から83.3%へ改善。

5. 議論はある?

- 結果は、LiteNWMが将来を考慮したplanningとclosed-loopナビゲーションを実ロボット上で実行可能であることを示す。 - 一方、要旨からは失敗事例、計算資源制約、安全性、長期運用時の性能劣化などに関する議論は不明。 - 提案手法の限界や適用範囲についての詳細は要旨からは不明。

6. 次に読むべき論文は?

- NoMaD - NWM-XL - MBRA - RECON - SCAND - SACSoN - 関連するvisual navigation policyおよびnavigation world modelの研究

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Linkai Liu, Yuntian Zhang, Zhenshan Bing, Chen Chen, Lingjuan Lyu, Shangguang Wang, Mengwei Xu, Dongqi Cai

分類: cs.RO

原文アブストラクト

Direct visual navigation policies generate trajectories efficiently but do not explicitly evaluate their future consequences. Generative navigation world models provide this foresight through visual rollouts, which are costly when evaluating multiple candidates. We present LiteNWM, a latent navigation world model that shares visual encoding across candidates and jointly predicts their action-conditioned future representations at multiple horizons, while a learned scorer uses these predictions to select trajectories. In offline evaluations on RECON, SCAND, and SACSoN, LiteNWM reduces macro-averaged trajectory error by 17.56% relative to NoMaD+NWM-XL and achieves a 128.00-fold end-to-end speedup on an RTX 5090. The same evaluator transfers from NoMaD to MBRA without proposer-specific retraining, reducing MBRA's macro-averaged trajectory error by 16.2%. In real-robot experiments in unseen indoor and outdoor environments, LiteNWM improves navigation success from 43.3% to 83.3% relative to NoMaD. These results demonstrate that LiteNWM can be deployed for future-aware planning and closed-loop navigation on a physical robot.

関連論文

PR本紙発行元 EmplifAI