日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLA/セキュリティarXiv:2608.15475

ビットフリップ攻撃による視覚言語行動モデルの脆弱性:行動デコードアーキテクチャが攻撃耐性を左右する

Bit-Flip Attacks on Vision-Language-Action Models: Action-Decoding Architecture Shapes the Vulnerability

シェア:XThreadsFacebookLINEはてブBluesky

量子化された視覚言語行動(VLA)モデルに対する初のビットフリップ攻撃を提案し、少数のフリップで閉ループ成功率を0%にできることを示した。攻撃に必要なフリップ数は行動ヘッドの種類に依存し、直接回帰やトークンポリシーでは1〜5回、フローマッチングでは100〜300回必要である。

詳しい要約

1. どんなもの?

本論文は、量子化されたVision-Language-Action (VLA)モデルに対する初のビットフリップ攻撃を提案する。RowhammerスタイルのフォールトによりINT8ビットが反転する状況を想定し、少数の勾配選択フリップで閉ループ成功率を0%にできることを示す。また、アクション生成層に損傷ビットが集中するが、攻撃に必要なフリップ数はアクションヘッドの種類に依存することを明らかにする。

2. 先行研究と比べてどこがすごい?

従来のビットフリップ攻撃は主に画像分類やLLMを対象としており、VLAモデルへの適用は初めてである。また、アクションデコーディングアーキテクチャ(直接回帰、トークンポリシー、フローマッチング)が攻撃脆弱性に与える影響を体系的に比較した点が新しい。さらに、固定方向の多様体エスケープ損失を導入し、フリップ予算を大幅に削減できることを示した。

3. 技術・手法の肝は?

手法の核心は、勾配情報を用いて重要な重みのビットを選択的に反転させること。特に、固定方向の多様体エスケープ損失を用いて、モデルの出力を行動多様体から逸脱させる方向にフリップを集中させる。また、アクションヘッドの種類(直接回帰、トークン、フローマッチング)ごとに脆弱性が異なることを利用し、攻撃予算を評価する。

4. どうやって有効だと検証した?

4つのモデルバリアント(3つのアクションヘッドファミリ)で評価。閉ループ成功率を0%にするフリップ数を測定し、直接回帰とトークンポリシーでは1〜5フリップ、フローマッチングでは約100〜300フリップ必要であることを示した。また、保護する重みの割合を変えて成功率を評価し、3.1%の保護でK=100で60%の成功率を維持、5.3%でオープンループ破壊閾値を3から100フリップに移動させた。実ロボット実験では、タスク調整済みのエミュレートK=100フリップで0/20成功(クリーン14/20、ランダム16/20)を確認。

5. 議論はある?

議論として、アクションヘッドの種類によって攻撃予算が大きく異なることが挙げられる。フローマッチングは比較的頑健だが、それでも数百フリップで破壊可能。また、保護する重みの割合と成功率のトレードオフが示され、完全な保護は困難である可能性が示唆される。さらに、攻撃が特定の方向に依存しないことを5方向スイープで確認したが、実世界でのRowhammer攻撃の実現可能性や、他の量子化方式への影響は要旨からは不明。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、ビットフリップ攻撃の元祖であるDeep Neural Networksのビットフリップ攻撃(例えば、Rakin et al.のBFAttack)や、Rowhammer攻撃に関する研究、VLAモデルの基盤となるVision-Language-Actionモデル(例えば、RT-2やOpenVLA)が挙げられる。また、フローマッチングポリシーに関する研究も関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Yudong Gao, Linghan Chen, Wenhan Wu, Mia Zhou, Jiyao Wang, Kaiyan Ji, Mingyu Guo, Honglong Chen

分類: cs.CR, cs.AI

原文アブストラクト

Quantized Vision-Language-Action (VLA) models expose a weight-fault surface: Rowhammer-style faults can corrupt deployed INT8 bits. We present the first bit-flip attack on a VLA: a few gradient-selected flips reduce closed-loop success to $0\%$, while hundreds of random flips are harmless. Across four model variants spanning three action-head families, damaging bits concentrate in a few action-generating layers, but the empirical budget depends sharply on the head: direct regression and token policies fall in $1$--$5$ flips, whereas the evaluated flow-matching policies require ${\sim}100$--$300$. Our fixed-direction manifold-escape loss cuts \pizero{}'s budget from ${\sim}1000$ to ${\sim}100$ flips, and a matched five-direction sweep shows that the attack is not specific to an all-positive direction. On a direct head, protecting $3.1\%$ of weights preserves $60\%$ success at $K{=}100$, and protecting $5.3\%$ moves the open-loop break threshold from 3 to 100 flips. Finally, task-calibrated emulated $K{=}100$ flips yield $0/20$ real-robot successes, versus $14/20$ clean and $16/20$ global-random. Weight integrity is therefore a security boundary for embodied foundation models. Code is included as ancillary material.

関連論文