日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2610.06271

VLA-ZO:視覚言語行動モデルのための高速ゼロ次適応

VLA-ZO: Fast Zeroth-Order Adaptation for Vision-Language-Action Models

シェア:XThreadsFacebookLINEはてブBluesky

VLAモデルの展開時の分布シフトに適応するため、行動側のみをゼロ次最適化で適応し、視覚言語部分を固定して計算を再利用することで高速化を実現した。

詳しい要約

1. どんなもの?

- VLA-ZOは、Vision-Language-Action (VLA) モデルを展開時の分布シフトに適応させるための、高速なZeroth-Order (ZO) 適応フレームワーク。 - 推論レベルのメモリで動作し、大規模VLAモデルでも実用的な速度を実現する。 - LIBEROのカメラ視点シフトにおいて、適応時間を大幅に短縮しつつタスク成功率を向上させる。

2. 先行研究と比べてどこがすごい?

- 従来の一次適応はメモリ予算を超えることがあり、推論向け展開プラットフォームに不向き。 - ナイーブなZOは勾配推定に多くの摂動クエリを要し、大規模VLAでは非現実的に遅い。 - VLA-ZOはZOの構造を活用し、ベースラインZOと比べて適応時間を25.59倍(q=16)および32.54倍(q=64)短縮。 - 適応なしの成功率48.27%から、それぞれ58.17%と63.58%へ改善。

3. 技術・手法の肝は?

- 適応をaction側に限定し、高コストなvision-language prefixを凍結。 - そのconditioning statesを摂動クエリとオプティマイザステップ間で再利用。 - schedule-aware prefetchingによりstate-transferオーバーヘッドを隠蔽。 - これにより、より大きなクエリ予算を実用的にする。

4. どうやって有効だと検証した?

- LIBEROのカメラ視点シフトで評価。 - ベースラインZOに対するend-to-end適応時間の短縮率を測定(q=16で25.59倍、q=64で32.54倍)。 - 平均タスク成功率を比較(適応なし48.27% vs. 適応あり58.17%と63.58%)。

5. 議論はある?

- ZOを高速化することで、より大きなクエリ予算が実用的になることを示す。 - 展開プラットフォーム上でのリソース効率的なVLA適応への有望な道筋を提供。 - 具体的な限界や失敗ケース、他の分布シフトへの一般化については要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究:ベースラインZO、一次適応(first-order adaptation)。 - 関連手法:Vision-Language-Action (VLA) モデル、Zeroth-Order (ZO) optimization、LIBEROベンチマーク。 - 同分野の定番:RT-1, RT-2, OpenVLAなどのVLAモデルや、LoRAなどのパラメータ効率適応手法が考えられるが、要旨では明示されていない。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Jaemin Kim, Jiahn Kim, Taesik Gong

分類: cs.RO, cs.AI

原文アブストラクト

Adapting vision-language-action (VLA) models to deployment-time distribution shifts is important for reliable robotic operation, but conventional first-order adaptation can exceed the memory budget of inference-oriented deployment platforms. Zeroth-order (ZO) optimization offers a forward-only alternative with inference-level memory, but accurate gradient estimation requires many perturbation queries, making naive ZO prohibitively slow for large VLA models. We present VLA-ZO, a framework for fast ZO adaptation that exploits the structure of VLA computation. By confining adaptation to the action side, VLA-ZO keeps the expensive vision-language prefix frozen and reuses its conditioning states across perturbation queries and optimizer steps, while schedule-aware prefetching hides state-transfer overhead. On LIBERO camera-viewpoint shifts, VLA-ZO reduces end-to-end adaptation time by 25.59$\times$ at $q=16$ and 32.54$\times$ at $q=64$ relative to baseline ZO, while improving average task success from 48.27% without adaptation to 58.17% and 63.58%, respectively. These results show that making ZO faster can make larger query budgets practical, providing a promising path toward resource-efficient VLA adaptation on deployment platforms.

関連論文

PR本紙発行元 EmplifAI