何が起きたか
2026年4月3日にarXivに投稿された論文(識別番号2604.03191v1)は、VLAモデルのスケーリングに関する「圧縮ギャップ」という情報理論的原則を提唱した。論文は、行動を離散トークンで表現する場合、視覚エンコーダの性能向上が下流の操作性能に反映されないことを示し、LIBEROベンチマークでの実験で検証した。
詳細
論文は、視覚エンコーダのアップグレードがVLAモデルの操作性能を向上させるとの期待が、行動を離散トークンで表現する場合には成立しないと主張する。その理由として、パイプライン内の最も狭い情報ボトルネックの位置がスケーリング挙動を決定するという「圧縮ギャップ」の原理を提唱した。連続行動表現(例: Diffusion Policy)では視覚エンコーダが制約となり、エンコーダのアップグレードが直接性能向上につながる。一方、固定容量のコードブックによる離散化(例: OAT)ではコードブックが制約となり、エンコーダの改善はコードブックを通過できない。 実験はLIBEROベンチマークで実施され、3つの証拠が示された。要因実験では、エンコーダのアップグレードがDiffusion Policyを21パーセントポイント以上改善した一方、OATの改善はモデル規模全体で大幅に減衰した。4つのエンコーダにわたる品質勾配実験では、Diffusion Policyはエンコーダ品質に単調に追従したが、OATは横ばいだった。コードブックサイズ実験では、コードブック容量の緩和がエンコーダ感度を部分的に回復し、ボトルネック仮説の因果的証拠を提供した。
Key Facts
| 論文は「圧縮ギャップ」という情報理論的原則を提唱し、VLAモデルのスケーリングはパイプライン内の情報ボトルネックの位置に依存すると主張している。 | [1] |
| 連続行動表現(例: Diffusion Policy)では視覚エンコーダが制約となり、エンコーダのアップグレードが直接性能向上につながる。 | [1] |
| 離散トークン表現(例: OAT)では固定容量のコードブックが制約となり、エンコーダの改善はコードブックを通過できない。 | [1] |
| LIBEROベンチマークでの要因実験では、エンコーダのアップグレードがDiffusion Policyを21パーセントポイント以上改善した一方、OATの改善はモデル規模全体で大幅に減衰した。 | [1] |
| コードブックサイズ実験では、コードブック容量の緩和がエンコーダ感度を部分的に回復し、ボトルネック仮説の因果的証拠を提供した。 | [1] |
なぜ重要か
この研究は、VLAモデルのスケーリングにおける「何を改善すべきか」という根本的な問いに情報理論的な枠組みを提供する。開発者にとっては、単にモデルやデータを大きくするのではなく、パイプライン内のボトルネックを特定することが重要であるという指針となる。また、離散トークン化の限界を示すことで、将来の行動表現の設計に影響を与える可能性がある。