何が起きたか

2026年4月3日にarXivに投稿された論文(識別番号2604.03191v1)は、VLAモデルのスケーリングに関する「圧縮ギャップ」という情報理論的原則を提唱した。論文は、行動を離散トークンで表現する場合、視覚エンコーダの性能向上が下流の操作性能に反映されないことを示し、LIBEROベンチマークでの実験で検証した。

詳細

論文は、視覚エンコーダのアップグレードがVLAモデルの操作性能を向上させるとの期待が、行動を離散トークンで表現する場合には成立しないと主張する。その理由として、パイプライン内の最も狭い情報ボトルネックの位置がスケーリング挙動を決定するという「圧縮ギャップ」の原理を提唱した。連続行動表現(例: Diffusion Policy)では視覚エンコーダが制約となり、エンコーダのアップグレードが直接性能向上につながる。一方、固定容量のコードブックによる離散化(例: OAT)ではコードブックが制約となり、エンコーダの改善はコードブックを通過できない。 実験はLIBEROベンチマークで実施され、3つの証拠が示された。要因実験では、エンコーダのアップグレードがDiffusion Policyを21パーセントポイント以上改善した一方、OATの改善はモデル規模全体で大幅に減衰した。4つのエンコーダにわたる品質勾配実験では、Diffusion Policyはエンコーダ品質に単調に追従したが、OATは横ばいだった。コードブックサイズ実験では、コードブック容量の緩和がエンコーダ感度を部分的に回復し、ボトルネック仮説の因果的証拠を提供した。

Key Facts

論文は「圧縮ギャップ」という情報理論的原則を提唱し、VLAモデルのスケーリングはパイプライン内の情報ボトルネックの位置に依存すると主張している。出典一覧
連続行動表現(例: Diffusion Policy)では視覚エンコーダが制約となり、エンコーダのアップグレードが直接性能向上につながる。出典一覧
離散トークン表現(例: OAT)では固定容量のコードブックが制約となり、エンコーダの改善はコードブックを通過できない。出典一覧
LIBEROベンチマークでの要因実験では、エンコーダのアップグレードがDiffusion Policyを21パーセントポイント以上改善した一方、OATの改善はモデル規模全体で大幅に減衰した。出典一覧
コードブックサイズ実験では、コードブック容量の緩和がエンコーダ感度を部分的に回復し、ボトルネック仮説の因果的証拠を提供した。出典一覧

本紙の見方

今回の論文は、VLAモデルのスケーリングに関する一般的な前提に疑問を投げかける。従来、視覚エンコーダの性能向上は下流タスクの改善につながると考えられてきたが、行動表現の形式によってその効果が遮断されることを示した点が新しい。特に、離散トークン化が広く用いられる中で、コードブックの容量がボトルネックとなるという指摘は、モデル設計の指針に影響を与える。 本紙の過去報道との接続はないが、この知見はPhysical AI分野におけるスケーリング戦略に重要な示唆を与える。モデルやデータの規模を一律に増やすのではなく、情報ボトルネックの位置を特定し、そこを解消することが効果的であると主張する。これは、計算資源の効率的な配分という観点から、業界の研究開発の方向性に影響を与える可能性がある。 一方で、この論文はLIBEROベンチマークに基づく検証であり、実世界の多様なタスクでの一般化は未確認である。また、コードブックの容量を増やすことの限界や、他の離散化手法との比較も今後の課題となる。次に確認すべきは、この原理が他のベンチマークや実ロボットでの操作タスクでも成立するか、またコードブックの設計を改善することでエンコーダの感度を回復できるかという点である。

なぜ重要か

この研究は、VLAモデルのスケーリングにおける「何を改善すべきか」という根本的な問いに情報理論的な枠組みを提供する。開発者にとっては、単にモデルやデータを大きくするのではなく、パイプライン内のボトルネックを特定することが重要であるという指針となる。また、離散トークン化の限界を示すことで、将来の行動表現の設計に影響を与える可能性がある。