何が起きたか

arxiv.orgに掲載された論文(2026年5月15日付)で、VLAモデルの訓練時に視覚言語モデル(VLM)の能力が劣化する問題を、脳の視覚経路を模した二経路構造で解決する手法が提案された。提案されたUnified Action Model(UAM)は、並列のDorsal Expertを追加し、VLMの能力を95%以上保持しながら、操作タスクで最高の平均成功率を達成したと報告されている。

詳細

論文は、VLAモデルが事前学習済みVLMを行動データで微調整する際に、VLMのマルチモーダル能力が体系的に損なわれる「embodiment tax」と名付けた副作用を指摘する。この劣化は、単一のエンコーダが言語基盤の意味と制御関連の視覚特徴の両方を支える構造的ボトルネックに起因すると分析。生物学的視覚の二経路構造(認識と視覚運動制御の分離)に着想を得て、UAMは脳の背側経路に相当する並列のDorsal Expertを追加する。Dorsal Expertは事前学習済み生成モデルから初期化され、視覚ダイナミクスを予測する中間レベルの推論目的で訓練される。これにより、パラメータ凍結、勾配停止、補助的なVL共訓練なしで、エンドツーエンドの訓練が可能となり、VLMのマルチモーダル能力の95%以上を保持しつつ、未見オブジェクトや新規のオブジェクト・ターゲット構成、指示変化を含む分布外汎化を試す多様な操作タスクで、ベースラインの中で最高の平均成功率を達成したとされる。

Key Facts

VLAモデルは事前学習済みVLMを行動データで微調整することで、VLMのマルチモーダル能力が体系的に損なわれる「embodiment tax」と呼ばれる副作用が生じる。[1]
提案手法UAMは、脳の背側経路に相当する並列のDorsal Expertを追加し、事前学習済み生成モデルから初期化して視覚ダイナミクスを予測する中間レベルの推論目的で訓練する。[1]
UAMはパラメータ凍結、勾配停止、補助的なVL共訓練なしでエンドツーエンドに訓練され、VLMのマルチモーダル能力の95%以上を保持する。[1]
UAMは、未見オブジェクト、新規のオブジェクト・ターゲット構成、指示変化を含む分布外汎化を試す多様な操作タスクで、ベースラインの中で最高の平均成功率を達成した。[1]

本紙の見方

今回の論文は、VLA(視覚言語行動)モデルの訓練における根本的な問題、すなわち事前学習済みVLMを行動データで微調整すると、そのマルチモーダル能力が劣化するという「embodiment tax」に、構造的な解決策を提示した点で新規性がある。従来の対策は、パラメータ凍結や補助データのリプレイなど、訓練プロセスに制約を課すものが多かったが、UAMはアーキテクチャ自体を変更することで、こうした制約なしに能力保持を実現している。これは、生物学的視覚の二経路構造(腹側経路と背側経路)に着想を得たもので、認識と制御を分離するという設計思想が、VLAの性能と汎化の両立に寄与することを示唆している。 本紙の過去報道との接続は、関連記事が提供されていないため直接の言及はできないが、ロボット学習分野における基盤モデルの活用が進む中で、この研究は「モデルの能力を保ちながら行動学習を行う」という課題に対する一つの回答を示している。特に、VLMのマルチモーダル能力を95%以上保持しながら、分布外汎化を試すタスクで最高の成功率を達成した点は、実世界の多様な状況への適応が求められるロボット応用において重要な意味を持つ。 業界構造への含意としては、VLAモデルの開発競争において、単に行動データで微調整するだけでは不十分で、アーキテクチャ設計が性能を左右するという点が強調される。これにより、モデル構造の研究がさらに重要性を増す可能性がある。また、Dorsal Expertを事前学習済み生成モデルから初期化する手法は、生成モデルの活用範囲を広げるものであり、サプライチェーン上では、基盤モデル提供企業とロボット開発企業の協業が進む可能性も考えられる。 未確定の論点としては、論文で報告された成功率がシミュレーション環境でのものか実機でのものかが明記されておらず、実環境での有効性は未確認である。また、Dorsal Expertの初期化に用いる生成モデルの選定基準や、計算コストの増加が実用化の障壁となる可能性も検討が必要だ。さらに、95%という能力保持率の測定方法や、他のVLAモデルへの適用可能性も今後の検証が待たれる。

なぜ重要か

この研究は、VLAモデルの訓練における「忘却」問題に対する新たな解決策を示し、ロボットの知能化において基盤モデルの能力を最大限活用する道を開く。アーキテクチャの分離が能力保持と汎化を両立させるという知見は、今後のVLA開発の指針となる可能性が高い。