何が起きたか
2026年5月25日、arXivに掲載された論文「Capability and Robustness Cannot Both Be Free: An Information-Theoretic Bound for Vision-Language-Action Models」が、VLAモデルの能力と堅牢性の間に情報理論的な上限が存在することを証明した。論文は、OpenVLA-7BがLIBEROベンチマークで成功率95%から5%未満に低下する例を挙げ、このトレードオフが理論的に避けられないことを示した。
詳細
論文は、任意のVLAポリシーについて、能力I(A*;A_hat)と堅牢性I(A_hat;A_tilde)-I(A_hat;δ)の和が、タスクエントロピーH(A*)と敵対的チャネル容量I(X;X_tilde)の和以下であることを証明した。証明はデータ処理不等式を2回適用することで得られる。ピクセルレベルのバウンドは約10^3ナットの緩さがあり、上限保証として機能するが、エンコーダー固有の系では1桁以上厳しくなり、実現された能力が予算の5〜9%を消費する領域に入る。検証は308セルで行われ、252の閉形式ガウスVLA、48のOpenVLA-7B+LIBERO+PGD(4スイート×4ε×3シード)、4のSquare-Attack、4のマルチステップ(T=10)を含み、定理の違反はゼロだった。さらに、離散トークン、L1回帰、フローマッチングにわたる144のクロスアーキテクチャセルで、測定可能性の不等式Rob_disc ≤ Cap_discが成立した。
Key Facts
| 論文は、任意のVLAポリシーにおいて、能力と堅牢性の和がタスクエントロピーと敵対的チャネル容量の和を超えないことを証明した。 | [1] |
| OpenVLA-7BはLIBEROベンチマークで、16/255のPGD攻撃により成功率が95%から5%未満に低下する。 | [1] |
| 検証は308セルで行われ、定理の違反はゼロだった。 | [1] |
| ピクセルレベルのバウンドは約10^3ナットの緩さがあり、エンコーダー固有の系では1桁以上厳しくなる。 | [1] |
| 測定可能性の不等式Rob_disc ≤ Cap_discは、144のクロスアーキテクチャセルで成立した。 | [1] |
なぜ重要か
この理論的限界は、VLAモデルの開発において、能力と堅牢性の両立が原理的に困難であることを示す。開発者は、性能向上と防御のバランスを考慮した設計を迫られ、理論的な上限を意識したアプローチが重要になる。また、提供された診断ツールは、モデル評価の標準化に寄与する可能性がある。