何が起きたか

arXivに公開された論文(2608.07267v1)で、WNM-3D(World Navigation Model with 3D Scene Conditioning)が提案された。これは連続VLN(視覚言語ナビゲーション)向けの生成型世界ナビゲーションモデルである。既存のVLNシステムは、事前学習済みの視覚言語モデルを視覚言語行動(VLA)ポリシーに適応させ、エゴセントリックな観測と言語指示を直接ナビゲーション行動にマッピングするが、行動中心の訓練では予測された動作の下で視覚観測がどう変化するかを明示的にモデル化しない。生成型世界行動モデル(WAM)は将来の観測と行動を共同予測するが、既存の連続VLN向けWAMは、観測履歴から推論される幾何学認識表現に基づいて将来視野と行動生成を条件付けない。WNM-3Dは、凍結したフィードフォワード幾何学エンコーダが単眼エゴセントリックRGB履歴から幾何学認識表現を抽出し、訓練可能な3D Scene-to-Token Adapterがそれらをワールドアクション拡散トランスフォーマーのトークン空間の固定長プレフィックスに変換する。ブロック因果注意により、このプレフィックスは将来のビデオアクションブロックごとに条件付けを行い、将来視野と行動生成の両方に共有の幾何学的文脈を提供する。WNM-3Dは、A*で生成されたデモンストレーションによる教師ありワールドアクション微調整、ポリシー訪問状態でのDAggerスタイル適応、DanceGRPOベースの閉ループポリシー最適化によって訓練される。GN-Benchでの実験では、WNM-3Dは強力なVLMベースのナビゲーションポリシーと2D条件付けの対応物を閉ループナビゲーションで上回った。固定されたニアゴール評価セットでは、WNM-3Dはより高いフローアクション整合性とより低い視覚運動誤差を達成した。

Key Facts

WNM-3Dは、連続VLN向けの生成型世界ナビゲーションモデルであり、3Dシーン条件付けを特徴とする。[0]
WNM-3Dは、凍結したフィードフォワード幾何学エンコーダと訓練可能な3D Scene-to-Token Adapterを使用する。[0]
WNM-3Dは、A*で生成されたデモンストレーション、DAggerスタイル適応、DanceGRPOベースの閉ループポリシー最適化で訓練される。[0]
GN-Benchの実験で、WNM-3Dは強力なVLMベースのナビゲーションポリシーと2D条件付けの対応物を閉ループナビゲーションで上回った。[0]
固定されたニアゴール評価セットでは、WNM-3Dはより高いフローアクション整合性とより低い視覚運動誤差を達成した。[0]

なぜ重要か

この研究は、連続VLNにおける生成型ワールドモデルの発展に寄与する。3Dシーン条件付けを導入することで、将来の視覚観測と行動の生成に幾何学的文脈を提供し、閉ループナビゲーション性能を向上させる可能性を示した。