日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2610.02626

未来を想像し要点を内在化:時空間想像を内部化した効率的VLA推論

Imagine the Future, Internalize the Gist: Efficient VLA Reasoning via Internalized Spatiotemporal Imagination

シェア:XThreadsFacebookLINEはてブBluesky

VLAモデルが将来のシーン変化を視覚表現空間で想像して行動予測を導く推論手法を提案し、その推論結果をコンパクトなトークンに内在化することで推論時の計算を大幅に削減した。

詳しい要約

1. どんなもの?

- Vision-language-action (VLA) モデル向けの推論フレームワーク IG-VLA を提案。 - 将来のシーン進化を想像し、その要点を内部化する。 - Latent Spatiotemporal Reasoning で視覚表現空間上に将来を想像。 - Scene Gist Memory で推論由来のシーン行動関連を Scene Gist Token に内部化。 - 推論時の明示的な将来想像を回避し効率化。

2. 先行研究と比べてどこがすごい?

- 既存 VLA は観測状態のみを推論し将来のシーン進化を明示的に予測しない。 - 毎推論で明示的将来ロールアウトを行うと計算オーバーヘッドが大きい。 - IG-VLA はピクセル動画生成なしで将来を想像し、推論時は内部化で回避。 - LIBERO-Plus Language で最強ベースラインを約6%上回る成功率。 - gist ポリシーは最大6.38倍高速化、遅延1081ms→169.5ms。

3. 技術・手法の肝は?

- Latent Spatiotemporal Reasoning: 視覚表現空間でタスク関連の将来シーン進化を想像。 - ピクセルレベル動画生成を避け、行動予測を導く。 - Scene Gist Memory: 推論由来のシーン行動関連を Scene Gist Token に内部化。 - 推論時は明示的将来想像をバイパスしつつ将来推論の利点を保持。 - これにより効率的な VLA 展開を実現。

4. どうやって有効だと検証した?

- LIBERO, LIBERO-Plus, VLABench で広範な実験。 - LIBERO-Plus Language スイートで reasoning と gist ポリシーが最強ベースラインを約6%上回る。 - gist ポリシーは最大6.38倍高速化。 - 単一 NVIDIA A6000 GPU で行動チャンクあたり遅延1081ms→169.5ms。 - 有効性と効率性を実証。

5. 議論はある?

- 将来の時空間推論を効率的 VLA 展開のために内部化可能と示す。 - 計算オーバーヘッド削減と性能維持の両立を主張。 - 具体的な限界や失敗ケース、一般化性の議論は要旨からは不明。 - 倫理的影響や実世界展開の課題は要旨からは不明。

6. 次に読むべき論文は?

- LIBERO, LIBERO-Plus, VLABench を用いた関連 VLA 研究。 - 中間推論を行う VLA モデル(例: 推論強化型 VLA)。 - 将来予測や世界モデルを用いるロボット操作手法。 - 効率的 VLA 推論やトークン内部化に関する研究。 - 要旨で参照/比較されている具体的論文名は不明。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Shenglan Li, Zhendong Mi, Hengyi Zhu, Jingwu Luo, Chun Kit Chan, Geng Yuan, Yanzhi Wang, Pu Zhao, Shaoyi Huang

分類: cs.CV

原文アブストラクト

Vision-language-action (VLA) models increasingly incorporate intermediate reasoning to improve robotic manipulation, yet existing approaches primarily reason about observed states without explicitly anticipating future scene evolution. Extending such reasoning to explicit future rollouts at every inference step, however, introduces substantial computational overhead. We propose IG-VLA, a VLA reasoning framework that enables models to imagine the future and internalize the gist. Our Latent Spatiotemporal Reasoning learns to imagine task-relevant future scene evolution directly in visual representation space, guiding action prediction without costly pixel-level video generation. To further reduce inference overhead, we introduce Scene Gist Memory, which internalizes reasoning-derived scene-behavior associations into a compact Scene Gist Token, preserving the benefits of future reasoning while bypassing explicit future imagination at inference. Extensive experiments on LIBERO, LIBERO-Plus, and VLABench demonstrate the effectiveness and efficiency of IG-VLA. On the LIBERO-Plus Language suite, both the reasoning and gist policies outperform the strongest baseline by nearly 6% in success rate. The gist policy also achieves up to 6.38x speedup over baselines, reducing inference latency from 1081ms to 169.5ms per action chunk on a single NVIDIA A6000 GPU. These results demonstrate that future spatiotemporal reasoning can be effectively internalized for efficient VLA deployment.

関連論文

PR本紙発行元 EmplifAI