日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2609.35570

EdgeVLN: 実行時認識型の展開可能な量子化視覚言語ナビゲーションモデル

EdgeVLN: Runtime-Aware Deployment Ready Quantized Vision Language Navigation Model

シェア:XThreadsFacebookLINEはてブBluesky

メモリ・電力制約のあるロボットエッジデバイス向けに、量子化した視覚言語ナビゲーションモデルと軽量な停止判定モジュールを組み合わせ、Jetson上でリアルタイム動作を実現した。

詳しい要約

1. どんなもの?

- メモリ・電力制約のあるロボットエッジデバイス上で動作する、量子化されたVision-Language Navigation (VLN) モデル「EdgeVLN」を提案。 - 量子化されたStreamVLNモデルと、軽量な因果TransformerであるLatent Trajectory Termination Extractor (LATTE) を組み合わせる。 - llama.cppベースのVLNドライバを通じて実行され、ストリーミングコンテキストの再構築とメモリトークンのオンボードでのプルーニングを行う。 - 重み量子化を8ビットから2ビットまで変化させ、複数の推論ランタイムを評価し、実行可能な動作点を特定する。

2. 先行研究と比べてどこがすごい?

- 従来のVLNモデルは計算リソースが豊富なプラットフォームを対象としており、エッジデバイスへの展開が困難であった。 - 単なる圧縮では、メモリ・レイテンシ・エネルギー予算に適合しつつナビゲーション行動を維持できるかは不明であった。 - EdgeVLNは、ランタイムを考慮した展開可能な量子化VLNモデルであり、このギャップを埋める。 - 4ビットモデルで最高の成功率58.02%を達成し、BF16ベースラインを上回りつつ、追加レイテンシは1ナビゲーションステップあたり0.013秒のみ。 - ストレージストリーミングBF16と比較して、20.8倍高速で13.3倍少ないエネルギーで動作。

3. 技術・手法の肝は?

- 量子化されたStreamVLNバックボーンとLATTEを組み合わせる。 - LATTEは軽量な因果Transformerで、Stop Action verifier rankを予測することでリアルタイム停止を改善する。 - LATTEはバックボーンの隠れ状態を再利用し、2つ目の視覚エンコーダや追加のバックボーン順伝播を必要としない。 - llama.cpp VLNドライバがストリーミングコンテキストを再構築し、メモリトークンをオンボードでプルーニングする。 - 重み量子化を8から2ビットまで特性評価し、複数の推論ランタイムを検討。

4. どうやって有効だと検証した?

- 6つのバックボーン精度と7つの候補停止ヘッドを、BF16とIQ4 NLで、R2R VLN-CE val-unseenの全1,839エピソードにわたって評価。 - シミュレーションで成功率 (SR) を測定し、NVIDIA Jetson Orin NX 16 GB上でレイテンシ、エネルギー、常駐メモリを測定。 - LATTEは展開された4ビットモデルで最高SR 58.02%を達成し、BF16ベースラインを上回った。 - 4ビットフォーマットはほぼ同一のSRを達成するが、ステップエネルギーは実行パスによって36.8倍変動。 - IQ4 NLのみがVLNドライバ下でボードに適合し、11.35 GBの常駐メモリを使用。INT2は崩壊。

5. 議論はある?

- ランタイム選択、メモリトークンプルーニング、量子化が効率的なエッジ展開に不可欠である。 - 4ビットフォーマット間でSRはほぼ同じだが、エネルギー消費は実行パスに大きく依存する。 - INT2量子化は性能が崩壊するため実用的でない。 - 要旨からは、他の議論(例えば一般化や異なる環境での性能)は不明。

6. 次に読むべき論文は?

- StreamVLN (ベースラインとして使用) - R2R VLN-CE (評価データセット) - llama.cpp (推論ランタイム) - 量子化手法 (8から2ビットまでの重み量子化) - 関連するVLNモデルやエッジ展開手法

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Rithvik Jonna, Man Namgung, Aakash Gurram, Tinoosh Mohsenin

分類: cs.RO, cs.CV

原文アブストラクト

Vision-language navigation (VLN) models perform well but target compute-rich platforms, limiting deployment on memory- and power-constrained robotic edge devices. Compression alone does not establish whether a VLN model fits the memory, latency, and energy budgets of an edge platform while preserving navigation behavior. We introduce EdgeVLN, a runtime-aware, deployment-ready quantized VLN model that closes this gap. EdgeVLN combines a quantized StreamVLN model with Latent Trajectory Termination Extractor (LATTE), a lightweight causal transformer that improves real-time stopping by predicting a Stop Action verifier rank. Both execute through our llama.cpp VLN driver, which reconstructs streaming context and prunes memory tokens on-board. We characterize a pretrained StreamVLN backbone across weight quantization from 8 to 2 bits and multiple inference runtimes to identify a feasible operating point. LATTE reuses backbone hidden states within the budget freed by quantization, requiring neither a second vision encoder nor an additional backbone forward pass. We evaluate six backbone precisions and seven candidate stop heads on BF16 and IQ4 NL across all 1,839 R2R VLN-CE val-unseen episodes. We measure success rate (SR) in simulation and latency, energy, and resident memory on an NVIDIA Jetson Orin NX 16 GB. LATTE achieves our highest SR, 58.02 percent on the deployed 4-bit model, exceeding the BF16 baseline with only 0.013 s additional latency per navigation step. Four-bit formats achieve nearly identical SR, but step energy varies 36.8 times by execution path. Only IQ4 NL under our VLN driver fits the board, using 11.35 GB resident memory while running 20.8 times faster and using 13.3 times less energy than storage-streamed BF16. INT2 collapses. Runtime selection, memory-token pruning, and quantization are essential for efficient edge deployment.

関連論文

PR本紙発行元 EmplifAI