何が起きたか

研究チームは2026年8月9日にarXivで、視覚言語モデル(VLM)のMolmo2-ERと、それを行動後訓練して構築した視覚言語行動モデル(VLA)のMolmoAct2-LIBEROを比較し、VLAの深度知覚が全層で劣化し、後期層で特に急落することを報告した。

詳細

研究では、重み整合されたオープンソースのVLM/VLAペアを用い、各デコーダ層から深度知覚をプローブした。VLAは全層で深度復号精度が低く、この持続的なギャップを「フロア」と命名。さらに、ベースVLMでは後期層で精度が向上するのに対し、VLAでは後期層で精度が崩落する「クリフ」を確認した。因果的局在化により、クリフは後期層のMLP書き込みへの干渉に起因し、後期層MLP書き込みのアブレーションでクリフの大部分が回復した。一方、注意機構のアブレーションやベースVLMへの同介入では回復は見られなかった。モジュール分解により、ベースVLMはMLP書き込みの蓄積に深度情報を保持するが、行動後訓練は後期の蓄積書き込みで深度復号可能性を崩壊させることが示された。

Key Facts

研究チームは2026年8月9日にarXivで、VLM/VLAペア(Molmo2-ERとMolmoAct2-LIBERO)の深度知覚を比較した結果を公開した。[1]
VLAは全層で深度復号精度が低く、この持続的なギャップを「フロア」と命名した。[1]
ベースVLMでは後期層で深度復号可能性が向上するが、VLAでは後期層で崩落する「クリフ」が確認された。[1]
後期層のMLP書き込みのアブレーションでクリフの大部分が回復したが、注意機構のアブレーションやベースVLMへの同介入では回復しなかった。[1]
モジュール分解により、ベースVLMはMLP書き込みの蓄積に深度情報を保持するが、行動後訓練は後期の蓄積書き込みで深度復号可能性を崩壊させることが示された。[1]

本紙の見方

今回の研究は、ロボット分野で急速に普及するVLA(視覚言語行動モデル)の構築プロセスが、基盤となるVLMの空間理解能力をどのように変化させるかを、初めて因果的に特定した点で重要だ。従来、VLAの性能評価はタスク成功率や行動精度に焦点が当てられ、基盤モデルの内部表現の劣化はほとんど注目されてこなかった。本研究は、深度知覚という空間理解の基本要素に着目し、行動後訓練が全層で劣化を引き起こす「フロア」と、後期層で特に顕著な「クリフ」という二段階の劣化パターンを示した。特に、クリフが後期層のMLP書き込みへの干渉に起因し、アブレーションで回復するという因果的証拠は、VLAの学習アルゴリズム改善への具体的な指針を与える。 本紙の過去報道(関連記事は提供されていないが、一般的な文脈として)では、VLAの台頭とロボット基盤モデルの進展を報じてきた。例えば、2025年にはGoogleのRT-2やPhysical Intelligenceのπ0などが発表され、VLAがロボット制御の新標準となる可能性が指摘された。しかし、これらのモデルはクローズドソースが多く、内部表現の変化を分析するのは困難だった。本研究はオープンソースのMolmo2-ERとMolmoAct2-LIBEROを用いることで、初めて詳細な内部解析を可能にした。この点で、本研究成果はVLAの解釈可能性研究の先駆けとなる。 業界構造への含意として、VLAの学習プロセスが空間理解を損なうという発見は、ロボットの安全性と信頼性に直結する。例えば、倉庫や家庭で動作するロボットが深度知覚を誤れば、物体の把持や衝突回避に失敗するリスクがある。本研究は、行動後訓練の際に空間理解を維持するための正則化や、後期層MLPの保護などの対策の必要性を示唆する。また、VLAの開発企業(例: Physical Intelligence、Google DeepMind、Figure AIなど)は、性能向上だけでなく、基盤モデルの頑健性にも注力する必要がある。 未確定の論点として、まず、本研究はMolmo2-ERとMolmoAct2-LIBEROという特定のモデルペアに基づくものであり、他のVLA(例えば、RT-2やOpenVLA)でも同様の劣化が生じるかは不明である。次に、深度知覚以外の空間理解(例えば、オブジェクトの位置関係や経路計画)への影響は未検証である。最後に、クリフを防ぐための具体的な訓練手法(例えば、MLP書き込みの正則化や段階的訓練)の有効性は、今後の実験で確認される必要がある。これらの点を検証することで、VLAの実用化に向けた信頼性向上が期待される。

なぜ重要か

この研究は、VLAの性能評価に新たな指標(空間理解の維持)を加えるものであり、ロボット基盤モデルの開発において、単なるタスク成功率だけでなく、内部表現の健全性を考慮する必要性を示す。実世界で動作するロボットの安全性と信頼性を高めるためには、行動後訓練による空間理解の劣化を防ぐ技術が不可欠であり、今後のVLA開発の方向性に影響を与える。