何が起きたか
arxiv.orgは2026-09-17、Vision-language-action(VLA)モデルの枝刈り後性能をオフラインで回復する手法「Recovering Aggressively Pruned Vision-Language-Action Models with Offline Hidden-State Distillation」を公開した。論文では、OpenVLA-OFTの言語バックボーンを63%削減すると、LIBERO-Longの成功率が93.2%から0.8%に低下するとしたうえで、隠れ状態蒸留により教師モデルとの差を3.5ポイント以内まで戻したとしている。研究は、オンラインのロールアウトを使わず、約8 GPU-hoursで回復できると報告した。
詳細
論文は、幅を削る「width pruning」ではブロックは細くなるが残差ストリームのサイズは元のまま保たれるため、教師と生徒の隠れ状態の形状が一致し、プロジェクタなしで直接対応づけられると説明している。学習は、教師1回分の実行で作成したキャッシュに対して行われ、63%削減した生徒を教師差3.5ポイント以内まで押し戻した。さらに、9段階の削減率を走査し、45%削減までは2手法の差が有意ではなく、63%〜87%の範囲で隠れ状態蒸留が+2.1〜+4.5ポイント、CogACTでは63%以降で+9.4〜+22.1ポイントの改善を示したとしている。 また、81%削減のCogACTでは、回復予算を3倍にすると蒸留済み生徒と教師の差は平均3.9ポイントまで縮み、監督学習による回復は20ポイント超下回った。6-DoFマニピュレーターでは、72%削減の蒸留済み生徒が成功率77.5%となり、監督学習回復の59.5%を上回った。オンボード実行では教師より2.23倍速く、メモリ使用量は62%少なかった。
Key Facts
| 論文名は「Recovering Aggressively Pruned Vision-Language-Action Models with Offline Hidden-State Distillation」である。 | [1] |
| 掲載日は2026-09-17である。 | [1] |
| OpenVLA-OFTでは、言語バックボーンを63%削減するとLIBERO-Longの成功率が93.2%から0.8%に低下したとされる。 | [1] |
| 隠れ状態蒸留により、63%削減した生徒モデルは教師との差を3.5ポイント以内まで回復したとされる。 | [1] |
| 6-DoFマニピュレーターでは、72%削減の蒸留済み生徒が77.5%の成功率、教師比2.23倍のオンボード高速化、62%のメモリ削減を示したとされる。 | [1] |
本紙の見方
本件の新しさは、VLAモデルの大きな枝刈りで失われた性能を、オンライン収集ではなくオフラインの隠れ状態蒸留で戻す点にある。特に、教師1回分の実行で作ったキャッシュを使い、約8 GPU-hoursで63%削減モデルを教師差3.5ポイント以内まで回復したという数字は、学習コストと実機適用の両面で意味を持つ。一方で、45%削減までは手法差が有意ではないとされており、この回復法はあらゆる圧縮率に一様に効くというより、損失が急増する高圧縮域で効く手段とみるのが自然である。 本紙の関連記事はないが、今回の論文は、ロボット上で動かすには大きすぎる言語バックボーンをどう扱うかというVLAの基本課題に直接触れている。ここで重要なのは、単にモデルを小さくする話ではなく、width pruningで残差ストリームの形状を保ったまま教師・生徒を直接合わせる設計にある。これは、圧縮後の再学習を別の大規模GPU計算に依存させる従来の回復手順とは異なり、実機に載せる前のオフライン処理として完結させる構造だといえる。 業界への含意は、計算資源の制約が強いロボット側で、どこまで大きいVLAを持ち込めるかという点に集約される。6-DoFマニピュレーターで示した2.23倍のオンボード高速化と62%のメモリ削減は、精度だけでなく機体側の推論予算を設計変数に戻す結果である。他方で、結果はOpenVLA-OFT、CogACT、6-DoFマニピュレーターという限られた評価系に基づくため、別アーキテクチャや別タスクでも同じ回復幅が出るかは未確定である。次に確認すべき論点は、より高い圧縮率での安定性、キャッシュ生成コストの詳細、そして実機データを使わない回復が長期運用でどこまで再現するかである。
なぜ重要か
論文が示したのは、オンラインロールアウトを回さずに圧縮後VLAの性能を戻せる可能性である。ロボット側の計算資源やメモリが限られる場合でも、63%削減後に教師差3.5ポイント以内、6-DoFマニピュレーターで2.23倍高速・62%省メモリという結果は、搭載推論の設計条件を変えうる。