日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2610.02697

GeoScaffold: 再構成によるコンパクトな幾何潜在表現の学習で効率的な視覚言語ナビゲーションを実現

GeoScaffold: Learning Compact Geometric Latents via Reconstruction for Efficient Vision-Language Navigation

シェア:XThreadsFacebookLINEはてブBluesky

訓練時のみ幾何再構成を監督として使い、推論時には追加コストなしで3D幾何を内部化した視覚言語ナビゲーションポリシーを学習する手法。

詳しい要約

1. どんなもの?

Vision-and-Language Navigation (VLN) において、egocentric RGB 観測と指示から低レベル行動を直接出力する streaming Video-LLM ポリシーに、3D 幾何の事前知識を内部化させる幾何監督フレームワーク GeoScaffold を提案。訓練時のみ幾何情報を注入し、推論時には追加コストをかけずに空間認識を向上させる。

2. 先行研究と比べてどこがすごい?

既存の geometry-aware 拡張は depth センサ、3D エンコーダ、毎ステップの知覚ツール呼び出しなど推論時コストを恒常的に負担する。GeoScaffold は訓練時に一度だけコストを払い、推論時は元の backbone と行動インターフェースを変更せずに幾何を内部化する点が優れる。

3. 技術・手法の肝は?

- 訓練軌跡の depth map で compact depth tokenizer を学習し凍結 - ポリシーを少数の learnable geometry query token で fine-tune - query の hidden state が depth, connectivity, traversability などのナビゲーション重要幾何を再構成するよう訓練 - この監督により query state が行動デコード用の compact geometric latent になる - 共有重みを通じて backbone 自体の表現にも幾何を内部化 - 訓練後は tokenizer, target generator, reconstruction head を破棄し、backbone と行動インターフェースは不変

4. どうやって有効だと検証した?

連続 VLN ベンチマークにおいて、主要な vision-only ナビゲータを一貫して上回ることを広範な実験で示した。

5. 議論はある?

軽量エッジ展開に向けた空間認識 embodied navigation モデルの実用的パラダイムを提供すると主張。具体的な限界や失敗事例、計算コストの詳細は要旨からは不明。

6. 次に読むべき論文は?

要旨で参照/比較されている研究は明示されていない。関連手法として streaming Video-LLM ポリシー、geometry-aware VLN 拡張、depth tokenizer を用いた表現学習、continuous VLN ベンチマークに関する論文が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Yixuan Jiang, Wentong Li, An Liu, Zihao Xin, Fulin Tang, Cong Leng, Yang Gao, Jian Cheng

分類: cs.RO, cs.CV

原文アブストラクト

Recent vision-and-language navigation (VLN) systems increasingly adopt streaming Video-LLM policies that map egocentric RGB observations and instructions directly to low-level actions. Yet these policies inherit weak 3D geometric priors from 2D pretraining. Existing geometry-aware extensions charge a persistent inference-time price: depth sensors, 3D encoders, or per-step perception tool calls. We propose GeoScaffold, a geometric supervision framework that pays this price once, at training time, by internalizing geometry into the policy itself. It first learns a compact depth tokenizer on depth maps from the training trajectories and freezes it. It then fine-tunes the policy with a handful of learnable geometry query tokens, training their hidden states to reconstruct navigation-critical geometry such as depth, connectivity, and traversability. This supervision turns the query states into compact geometric latents for action decoding, and through the shared weights also internalizes geometry into the backbone's own representations. Like a scaffold, the tokenizer, target generators, and reconstruction heads are discarded after training, leaving the backbone and action interface unchanged. Extensive experiments show that GeoScaffold consistently outperforms leading vision-only navigators on continuous VLN benchmarks, offering a practical paradigm for lightweight edge deployment of spatially aware embodied navigation models.

関連論文

PR本紙発行元 EmplifAI