日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ナビゲーションarXiv:2609.14561

GLAM: 大域的時空間記憶に基づく潜在世界モデルによる能動的探索とナビゲーション

GLAM: Training a latent world model over global spatiotemporal memory for active exploration and navigation

シェア:XThreadsFacebookLINEはてブBluesky

地図レベルの潜在トークン上で未来の地図表現とウェイポイントを予測するJEPA型世界モデルGLAMを提案し、ObjectNavタスクでベースラインを上回る成功率と経路長効率を達成した。

詳しい要約

1. どんなもの?

- GLAMは、能動的探索と意味的ナビゲーションのための目標条件付き潜在世界モデル。 - 全地球時空間メモリ上で訓練され、GLAM NAVという完全なナビゲーションシステムを構成。 - 履歴マップトークン、ナビゲーション目標、現在のロボット姿勢を入力とし、将来のマップ表現とロボット中心のウェイポイント潜在変数を共同予測。 - 将来の空間コンテキストとナビゲーション意図を共有表現空間で推論可能。

2. 先行研究と比べてどこがすごい?

- 先行研究と比べて、RGB再構成ではなくマップレベルの潜在トークン上で直接動作する点が特徴的。 - JEPAライクな潜在予測パラダイムを採用し、事前訓練されたウェイポイントエンコーダ・デコーダでナビゲーション計画を監督・復号。 - 再現されたBSC-Navベースラインと比較して、成功率と経路長重み付き成功率の両方で改善。

3. 技術・手法の肝は?

- JEPAライクな潜在予測パラダイムを採用。 - マップレベルの潜在トークン上で直接動作し、RGB再構成を行わない。 - 事前訓練されたウェイポイントエンコーダ・デコーダを用いてナビゲーション計画を監督・復号。 - 訓練データはHabitat上でHM3D v0.2シーンアセットを用いたObjectNavエキスパート軌跡を再生し、マルチタイムスケール予測サンプルにスライスして収集。

4. どうやって有効だと検証した?

- 制御されたHM3D-ObjectNavサブセット再現設定で評価。 - 再現されたBSC-Navベースラインと比較し、成功率と経路長重み付き成功率の両方で改善を確認。

5. 議論はある?

- 要旨からは不明。

6. 次に読むべき論文は?

- BSC-Nav(ベースラインとして再現・比較) - JEPA(潜在予測パラダイムの関連手法) - ObjectNav(タスク設定) - Habitat(シミュレーション環境) - HM3D v0.2(データセット)

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: I-Tak Ieong, Ruizhi Feng, Zhaoyang Lu, Yifei Cao, Jiayao Zhao, Leon Li, Senhua Zhu, Wenbo Ding

分類: cs.RO

原文アブストラクト

Active exploration and semantic navigation require an embodied agent to build memory from partial observations, predict how the evolution of observed spatial memory may support future motion, and convert that prediction into actionable plans. We present GLAM, a goal-conditioned latent world model trained over global spatiotemporal memory, and GLAM NAV, the complete navigation system built around it. Given historical map tokens, a navigation goal, and the current robot pose, GLAM jointly predicts future map representations and robot-centric waypoint latents, allowing future spatial context and navigation intent to be inferred in a shared representation space. The model follows a JEPA-like latent prediction paradigm, operates directly on map-level latent tokens rather than RGB reconstruction, and uses a pretrained waypoint encoder-decoder to supervise and decode navigation plans within GLAM NAV. Training data are collected by replaying ObjectNav expert trajectories in Habitat over HM3D v0.2 scene assets and slicing them into multi-timescale prediction samples. On a controlled HM3D-ObjectNav subset reproduction setting, GLAM NAV improves over a reproduced BSC-Nav baseline in both success rate and success weighted by path length.

関連論文