日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2609.26131

StepTrigger:VLM搭載脚ロボットに対する接触状態トリガ型バックドア攻撃

StepTrigger: Contact-State-Triggered Backdoor Attacks on VLM-Powered Legged Robots

シェア:XThreadsFacebookLINEはてブBluesky

脚ロボットの足裏圧力・接地パターンを隠しトリガとして学習させ、VLMプランナーの目標選択を密かに切り替えるバックドア攻撃を提案し、良性接触と悪性接触を選別する方策を評価した。

詳しい要約

1. どんなもの?

- VLMをhigh-level plannerとして用いるlegged robotに対するbackdoor attack - 提案手法はStepTriggerと命名 - triggerはprompt tokenや可視マーカーではなく、Unitree Go1がdense terrain patchを歩行する際に生じるpressureとfoot-ground contact pattern - 通常時は正常動作し、隠れたtrigger存在時のみtarget selectionを変更する - 要旨からは不明な点として、具体的なタスク内容や攻撃目的の詳細は記述されていない

2. 先行研究と比べてどこがすごい?

- 従来のLLM-powered/embodied agentへの攻撃はlanguage、camera-visible object、scene semantics、past action sequenceに依存するtriggerが主流 - StepTriggerはこれらと異なり、proprioceptive/contact channelをtriggerとして利用 - 言語・視覚・行動履歴に注目したdefenseでは捉えられない新たなbackdoor surfaceを提示 - 要旨からは不明な点として、既存手法との定量的比較は示されていない

3. 技術・手法の肝は?

- contact signalは本質的にnoisyで、benign locomotion中にもpressure anomalyが生じうる - すべてのpressure anomalyをtriggerと扱わないため、multimodal robot stateからselective backdoor policyを学習 - incidental pressure eventをbenign example、dense-patch contactをpoisoned exampleとして使用 - これによりtriggerと通常の接触ノイズを区別する選択的backdoorを実現 - 要旨からは不明な点として、モデルアーキテクチャや学習アルゴリズムの詳細は記述されていない

4. どうやって有効だと検証した?

- stratified offline evaluationで検証 - clean behavior preservation: 98.75% - false-trigger rejection: 92.50% - true-trigger activation: 76.25% - overall parsed behavior accuracy: 89.17% - 要旨からは不明な点として、実機実験の有無や評価データセットの詳細は記述されていない

5. 議論はある?

- proprioceptiveおよびcontact channelにbackdoor surfaceが存在することを示唆 - language、vision、action historyのみに焦点を当てたdefenseではこのsurfaceを捉えられないと主張 - 要旨からは不明な点として、防御策の提案や限界・倫理的議論の詳細は記述されていない

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究は明示されていない - 関連手法として、LLM-powered agentへのbackdoor attack、embodied agentへのtrigger攻撃、VLM-based robot planner、Unitree Go1を用いたlegged locomotion研究 - 同分野の定番として、vision-language model、backdoor attack、proprioceptive sensing、contact-based perceptionに関する研究が挙げられる

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Jiageng Zhang, Doniyorkhon Obidov, Kaichen Yang

分類: cs.RO, cs.AI, cs.CR

原文アブストラクト

Large language models and vision-language models are increasingly used as high-level planners in robotic systems, using task goals and sensor summaries to select navigation or manipulation actions. This creates a new backdoor surface: a compromised planner can behave normally in most runs, yet change its target selection when a hidden trigger is present. Prior attacks on LLM-powered or embodied agents mainly rely on triggers that appear in language, camera-visible objects, scene semantics, or specific sequences of past actions. This paper presents StepTrigger, a contact-state-triggered backdoor attack for VLM-powered legged robots. The trigger is not a prompt token or a visible marker. It is produced by pressure and foot-ground contact patterns that arise when a Unitree Go1 quadruped walks across a dense terrain patch. Unlike conventional visual or textual triggers, contact signals are inherently noisy and may also arise during benign locomotion. To avoid treating every pressure anomaly as a trigger, StepTrigger learns a selective backdoor policy from multimodal robot state, using incidental pressure events as benign examples and dense-patch contacts as poisoned examples. In a stratified offline evaluation, the trained planner achieved 98.75% clean behavior preservation, 92.50% false-trigger rejection, 76.25% true-trigger activation, and 89.17% overall parsed behavior accuracy. These results reveal a backdoor surface in proprioceptive and contact channels that is not captured by defenses focused only on language, vision, or action history.

関連論文

PR本紙発行元 EmplifAI