日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
セキュリティ/VLAarXiv:2608.26578

TrapVLA: 設定された失敗モードへのVLAモデルのトラッピング

TrapVLA: Trapping Vision-Language-Action Models in Configured Failure Modes

シェア:XThreadsFacebookLINEはてブBluesky

視覚言語行動モデルに対するバックドア攻撃の新タスクを提案し、テキストトリガーで特定の失敗パターンを誘発する手法を開発した。

詳しい要約

1. どんなもの?

本論文は、Vision-Language-Action (VLA) モデルに対する新しいバックドア攻撃タスクである Configured Failure Trapping を提案している。これは、ステルスなテキストトリガーによって攻撃を活性化し、指定された失敗モード(例:ロボットに指定された位置オフセットで把持させる)を引き起こすことを目的とする。従来のバックドア攻撃がタスクの失敗を成功とみなすのに対し、Configured Failure Trapping は攻撃者がロボットの失敗の仕方を制御することを要求し、より困難で検出が難しい。このタスクを支援するために、高品質な目標軌道を合成するデータエンジンと、設定された失敗の忠実度を測定する自動化スイートを提案する。さらに、4つの代表的な失敗モードにわたって Configured Failure Trapping を具体化する2つのベンチマーク(Trap-LIBERO と Trap-RoboTwin)を構築する。このタスクに対処するため、スパースなアクション偏差が重要な課題であると特定し、トリガー誘発アクション残差を明示的に学習してポリシ…

2. 先行研究と比べてどこがすごい?

先行研究のバックドア攻撃は、タスクの失敗を攻撃成功とみなす単純なものであったが、本手法は攻撃者が失敗の仕方(例:位置オフセット)を制御することを要求する点で新しい。これにより、攻撃の検出がより困難になり、攻撃の忠実度を評価するための新しい指標とベンチマークが必要となる。また、スパースなアクション偏差という課題を特定し、アクション残差を学習する手法を提案している点が先行研究と異なる。

3. 技術・手法の肝は?

手法の肝は、トリガー誘発アクション残差を明示的に学習することである。具体的には、VLA モデルにトリガーが入力された際に、通常のアクションに加えて残差を加えることで、設定された失敗モードを引き起こす。また、高品質な目標軌道を合成するデータエンジンと、失敗忠実度を測定する自動化スイートを構築し、Trap-LIBERO と Trap-RoboTwin のベンチマークを提供する。

4. どうやって有効だと検証した?

シミュレーションベンチマーク(Trap-LIBERO と Trap-RoboTwin)と実世界のロボット設定で実験を行い、TrapVLA がクリーンデータの性能をほぼ維持しながら、設定された失敗モードを効果的に注入できることを検証した。具体的な評価指標は要旨からは不明だが、失敗忠実度とクリーンデータ性能の両方を評価していると推測される。

5. 議論はある?

要旨からは、攻撃の検出可能性や防御策に関する議論は明示されていない。また、実世界での実験の詳細や、異なる VLA モデルへの一般化についての議論も不明である。さらに、データエンジンで合成された軌道の品質が攻撃成功率に与える影響など、追加の分析が必要かもしれない。

6. 次に読むべき論文は?

要旨で参照されている先行研究は明示されていないが、関連する分野として、VLA モデル(Vision-Language-Action models)のバックドア攻撃や、ロボット学習における攻撃と防御に関する研究が挙げられる。具体的には、Neural Backdoor Attack や Data Poisoning に関する論文、また VLA モデルの基盤となる RT-2 や PaLM-E などのモデル論文が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Jun-Hui Liu, Kun-Yu Lin, Yi-Lin Wei, Xu-Han Chen, Yinghao Li, Zhuohao Li, Yuan-Ming Li, Qing Zhang, Xiaoyi Fan, Dongmei Jiang, Yan Li, Wei-Shi Zheng

分類: cs.RO, cs.CV

原文アブストラクト

This work introduces Configured Failure Trapping, a novel backdoor attack task against Vision-Language-Action (VLA) models, which aims to activate attacks through stealthy textual triggers and induce configured failure modes. Unlike prior backdoor attacks that treat any task failure as a successful attack, Configured Failure Trapping requires the attacker to control how the robot fails (e.g., causing the robot to grasp with a specified positional offset), making it substantially more challenging and hard to detect. To support the new task, we propose an effective data engine for synthesizing high-quality target trajectories and an automated suite for measuring configured-failure fidelity. Then, based on this foundation, we construct two new benchmarks, namely Trap-LIBERO and Trap-RoboTwin, that instantiate Configured Failure Trapping across four representative failure modes. To address this task, we identify sparse action deviation as a critical challenge and accordingly propose a novel method named TrapVLA, which explicitly learns trigger-induced action residuals to steer the policy toward the configured failure behavior. Extensive experiments across simulation benchmarks and real-world robotic settings show that TrapVLA effectively injects configured failure modes into VLA models while largely preserving performance on clean data. Project page: https://john-liua.github.io/TrapVLA/

関連論文