何が起きたか

arXivに公開された論文「DRIFT: Derailing Denoising Trajectories of Flow-Matching VLAs with Adversarial Patch Attack」は、Flow-matching型のVision-Language-Action(VLA)モデルであるpi0が、敵対的摂動に対して耐性を持つという従来の報告は「ほぼ幻覚」であると主張している。従来の攻撃が多段階のdenoising ODEを無視していたためだと説明する。研究チームは、ロボットのグリッパーに配置するテスト時ユニバーサル・アドバーサリアル・パッチ「DRIFT」を導入し、オフ・ザ・シェルフのポリシーのdenoising速度場を攻撃する。中心的な発見として、最初のdenoisingステップのみを攻撃する方が、より広いステップ範囲を攻撃するよりも強力かつ低コストであると報告。これは入力空間最適化に特有の勾配競合によるもので、トレーニング時のバックドアとは正反対の現象だと説明している。pi0およびpi0.5の4つのLIBEROスイートにおいて、DRIFTは小さな単一パッチで本質的に全ての解けるタスクを破壊し、アクション空間および埋め込み空間の攻撃ベースラインを大幅に上回った。

Key Facts

Flow-matching型VLAモデル(pi0など)は、学習されたdenoising速度場を積分してロボットのアクションを生成し、自己回帰型VLAを容易に騙す敵対的摂動に耐性があると報告されてきた。[0]
研究チームは、このロバスト性は「ほぼ幻覚」であり、従来の攻撃が多段階のdenoising ODEを無視していたことに起因すると主張している。[0]
研究チームは、ロボットのグリッパーに配置するテスト時ユニバーサル・アドバーサリアル・パッチ「DRIFT」を導入した。[0]
DRIFTは、オフ・ザ・シェルフのポリシーのdenoising速度場を攻撃する。[0]
中心的な発見として、最初のdenoisingステップのみを攻撃する方が、より広いステップ範囲を攻撃するよりも強力かつ低コストであると報告している。[0]
この現象は、入力空間最適化に特有の勾配競合によるもので、トレーニング時のバックドアとは正反対であると説明している。[0]
pi0およびpi0.5の4つのLIBEROスイートにおいて、DRIFTは小さな単一パッチで本質的に全ての解けるタスクを破壊し、アクション空間および埋め込み空間の攻撃ベースラインを大幅に上回った。[0]

なぜ重要か

この研究は、Flow-matching型VLAモデルの敵対的摂動に対するロバスト性が過大評価されている可能性を示す。ロボットのグリッパーに物理的なパッチを貼るだけで、pi0やpi0.5のタスク成功率をほぼゼロにできると報告されており、実世界のロボットシステムにおけるセキュリティ上の懸念を提起する。