何が起きたか
研究チームは、VLAモデル全体を均一なW4A4精度に量子化する訓練不要のPTQフレームワーク「HoloQ-VLA」を発表した。LIBEROベンチマークでPi-0.5とGR00T-N1.5を圧縮し、それぞれ98.0%と87.8%のタスク成功率を達成、FP16参照の97.1%と87.0%を上回った。静的メモリ使用量は74.2%削減された。
詳細
HoloQ-VLAは、言語バックボーンと拡散アクションヘッド全体を、混合精度を使わずに均一なW4A4精度へ圧縮する。外れ値の原因となる重みと活性化の2つの源に対し、重み適応回転とアダマール変換を組み合わせ、さらにアクションヘッドのノイズ除去ステップ間のダイナミックレンジの変動を吸収するステップごとのスケーリングを適用する。実世界の操作実験でも、多様なシナリオでスムーズで正確な制御を維持したと報告されている。
Key Facts
| HoloQ-VLAは、訓練不要のPTQフレームワークで、言語バックボーンと拡散アクションヘッド全体を均一なW4A4精度に圧縮する(混合精度なし)。 | [1] |
| LIBEROベンチマークで、Pi-0.5は98.0%、GR00T-N1.5は87.8%のタスク成功率を達成し、FP16参照(97.1%、87.0%)を上回った。 | [1] |
| 静的メモリ使用量は74.2%削減された。 | [1] |
| HoloQ-VLAは、重み適応回転とアダマール変換、およびステップごとのスケーリングを組み合わせて外れ値に対処する。 | [1] |
| 実世界の操作実験で、多様なシナリオでスムーズで正確な制御を維持した。 | [1] |
なぜ重要か
HoloQ-VLAは、VLAモデルのオンデバイス展開を現実的にする可能性を示す。メモリ使用量を大幅に削減しつつ性能を維持できるため、ロボットやエッジデバイスでの高度な操作タスク実装が進むとみられる。ただし、実用化にはさらなる検証が必要であり、今後の研究動向が注目される。