日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLA/空間理解arXiv:2608.08904

回復から低下へ:アクション事後学習がVLMの後層深度デコード可能性を減少させる仕組み

From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability

シェア:XThreadsFacebookLINEはてブBluesky

VLA構築のためのアクション事後学習が、VLMの空間理解(特に深度知覚)をどのように劣化させるかを、層ごとのプローブで分析した論文。後層のMLP干渉が主因であることを特定した。

詳しい要約

1. どんなもの?

本研究は、VLMを行動ポストトレーニングしてVLAを構築する過程で、空間理解(特に深度知覚)がどの程度失われるかを調査する。オープンソースのMolmo2-ER(ベースVLM)とMolmoAct2-LIBERO(VLA)の各デコーダ層から深度をプローブし、VLAは全層で深度デコードが劣化する「floor」と、後期層でさらに急激に劣化する「cliff」を発見した。

2. 先行研究と比べてどこがすごい?

先行研究ではVLAの空間理解の劣化が報告されているが、本研究は層ごとの詳細な分析により、劣化が一様でなく後期層で特に顕著であること、その原因が後期層のMLP干渉にあることを因果的に特定した点が新しい。

3. 技術・手法の肝は?

手法の肝は、重みが一致したベースVLMとVLAのペアを用いて、各デコーダ層から線形プローブで深度をデコードし、層ごとのデコード可能性を比較した点。さらに、後期層のMLP書き込みをアブレーションすることで、cliffの大部分が回復することを示し、注意機構のアブレーションやベースVLMへの同介入では回復しないことを対照実験で示した。モジュールレベルの分解により、ベースVLMでは深度が累積MLP書き込みに保持されるが、VLAでは後期累積書き込みで深度デコード可能性が崩壊することを示した。

4. どうやって有効だと検証した?

有効性の検証は、Molmo2-ERとMolmoAct2-LIBEROのペアを用いて、各層からの深度デコード精度を比較し、floorとcliffの存在を確認した。さらに、後期層MLPアブレーションによりcliffの大部分が回復することを示し、注意アブレーションやベースVLMへの同介入では回復しないことを対照として示した。

5. 議論はある?

議論として、VLAの行動ポストトレーニングが空間理解を損なうメカニズムとして後期層MLP干渉が示唆されるが、他のタスクやモデルへの一般性は要旨からは不明。また、深度知覚の低下が実際のロボット操作性能にどの程度影響するかは未検証である。

6. 次に読むべき論文は?

次に読むべき論文は、VLAの行動ポストトレーニングに関する研究(例:RT-2やOpenVLA)や、VLMの空間理解を調査した研究(例:CLIPやVision Transformerのプロービング研究)が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Alexander Hackett, Arnaud Denis-Remillard, Axel Cassou

分類: cs.CV, cs.AI, cs.LG

原文アブストラクト

How much of a vision-language model's (VLM) spatial understanding remains after the action post-training process of building a vision-language-action model (VLA)? We probe depth perception, a primitive of spatiogeometric understanding, from every decoder layer of a weight-matched open-source base VLM/VLA pair: Molmo2-ER and MolmoAct2-LIBERO. First, the VLA decodes depth worse at every layer, a persistent gap we call the floor. Second, the degradation is not uniform: while the base VLM's depth decodability improves through its final layers, the VLA's collapses, an additional late-layer drop we call the cliff. We causally localize the cliff to late-layer MLP interference: ablating the late-layer MLP writes recovers the majority of the terminal decodability cliff, while matched attention ablations and the same intervention in the weight-matched base VLM produce no comparable recovery. A module-level decomposition explains this dissociation: the base VLM carries depth most accessibly in accumulated MLP writes, whereas action post-training collapses depth decodability in the late accumulated writes.