何が起きたか

2026年2月14日、arXivにプレプリント『HBVLA: Pushing 1-Bit Post-Training Quantization for Vision-Language-Action Models』が公開された。研究チームは、VLAモデル向けの二値化フレームワークHBVLAを提案し、1ビット量子化でも高い性能を維持できると報告している。

詳細

HBVLAは、ポリシー認識型の拡張ヘシアンを用いて行動生成に重要な重みを特定し、非重要重みにはスパース直交変換を適用して低エントロピーな中間状態を誘導する。その後、重要・非重要の両方の重みをハール領域でグループ単位の1ビット量子化を行う。評価では、LIBERO上でOpenVLA-OFTを量子化した場合に全精度の92.2%の性能を維持し、SimplerEnv上でCogActを量子化した場合に93.6%を維持した。実機評価スイートでも、全精度モデルと比較して成功率の低下は僅かであり、ハードウェア制約の厳しい環境での展開可能性を示した。

Key Facts

HBVLAはVLAモデル向けの二値化フレームワークであり、ポリシー認識型の拡張ヘシアン、スパース直交変換、ハール領域でのグループ単位1ビット量子化を組み合わせる。[1]
LIBERO上で量子化されたOpenVLA-OFTは全精度の92.2%の性能を維持した。[1]
SimplerEnv上で量子化されたCogActは93.6%の性能を維持し、最先端の二値化手法を上回った。[1]
実機評価スイートでは、HBVLAは全精度モデルと比較して成功率の低下は僅かであり、ハードウェア制約下での展開可能性を示した。[1]

なぜ重要か

VLAモデルのエッジ展開は、ロボットや組み込みシステムでの実用化に不可欠であり、本手法はその障壁を下げる可能性がある。1ビット量子化による性能維持は、ハードウェア制約下での展開を現実的にし、今後のロボットAIの普及に寄与すると考えられる。