日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLA/ロボットセキュリティarXiv:2609.31110

AuthGuard-R:LLM制御ロボットの安全準拠型ミッションハイジャックと二重ゲート防御

AuthGuard-R: Safety-Compliant Mission Hijacking and Dual-Gate Defense for LLM-Controlled Robots

シェア:XThreadsFacebookLINEはてブBluesky

物理的に安全でもユーザー認可ミッションを逸脱する「安全準拠型ミッションハイジャック」攻撃を定式化し、署名付きミッションに実行を束縛する認可層AuthGuard-Rと適応的攻撃MissionPAIRを提案・検証した論文。

詳しい要約

1. どんなもの?

- LLMを高レベルプランナとして用いる移動ロボット・マニピュレータ・自動運転車を対象とした研究。 - 物理的に安全でもユーザ認可ミッションに違反する攻撃を『safety-compliant mission hijacking』と定義。 - 攻撃フレームワーク MissionPAIR と、認可層 AuthGuard-R を提案。 - AuthGuard-R は署名済みミッション・ロボットID・物体/領域スコープ・状態・時刻・入力来歴に各実行可能行動を束縛。 - 独立した safety gate と組み合わせ dual-gate アーキテクチャを構成。

2. 先行研究と比べてどこがすごい?

- 従来の防御は『提案行動が物理的に安全か』を問うものが多い。 - 本研究は『物理的に安全でも認可ミッションに違反する』問題を扱う点が異なる。 - 配送ロボットの経路変更、承認物体の置換、動作領域拡大、不要センサ起動、ミッション遅延など、即時の物理的危険を生まない攻撃を対象化。 - 認可の健全性・ミッション非エスカレーション・リプレイ耐性・ロボット束縛・来歴分離・閾値承認安全性・監査ログ改ざん証拠・トレースレベル合成を形式化・証明。

3. 技術・手法の肝は?

- MissionPAIR: safety gate を通過しつつ認証済みミッションに違反する実行可能計画を探索する適応的攻撃フレームワーク。 - AuthGuard-R: 決定論的認可層。各実行可能行動を署名済みミッション、ロボットID、物体・領域スコープ、現在状態、時刻、入力来歴に束縛。 - 独立した safety gate と併用する dual-gate アーキテクチャ。 - ロボットトレース上のミッションポリシーを形式化し、セキュリティゲームを定義。 - 認可健全性、ミッション非エスカレーション、リプレイ耐性、ロボット束縛、来歴分離、閾値承認安全性、監査ログ改ざん証拠、トレースレベル合成を証明。

4. どうやって有効だと検証した?

- Claude Haiku 4.5 とオープンソース Qwen2.5 7B planner を用いた予備的クロスモデル評価を報告。 - 240 回のライブ攻撃試行で、planner は 109 回注入ミッション逸脱に従った。 - AuthGuard-R はその 109 件の未認可行動をすべて拒否。 - 別途手作業で構築した 11 件のプロトコル・ポリシーレベル攻撃スイートも完全に阻止。

5. 議論はある?

- 要旨からは不明。 - 予備的評価であり、より広範なモデル・タスク・実機環境での検証や、dual-gate の運用コスト・可用性・敵対的適応への議論は要旨では触れられていない。

6. 次に読むべき論文は?

- MissionPAIR(本論文の攻撃フレームワーク) - AuthGuard-R(本論文の認可層) - Claude Haiku 4.5 - Qwen2.5 7B planner - 関連する LLM-controlled robot の安全性・セキュリティ研究(要旨で個別参照は明示されていないため、同分野の一般的な防御研究を含む)

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Saidattu Chepuri, Vikas Srivastava

分類: cs.RO, cs.CR

原文アブストラクト

Large language models are increasingly used as high-level planners for mobile robots, robot manipulators, and autonomous vehicles. Recent studies show that these systems can be influenced through malicious text, speech, visual instructions, retrieved documents, and poisoned sensory context. Most defenses ask whether a proposed action is physically safe. This paper studies a different problem: an action may be physically safe and still violate the mission authorized by the user. An attacker may redirect a delivery robot, replace an approved object, extend a robot's operating region, activate an unnecessary sensor, or delay a mission without creating an immediate physical hazard. We call this attack \emph{safety-compliant mission hijacking}. We propose MissionPAIR, an adaptive attack framework that searches for executable plans that pass a safety gate while violating an authenticated mission. We also propose AuthGuard-R, a deterministic authorization layer that binds every executable action to a signed mission, robot identity, object and region scope, current state, time, and input provenance. AuthGuard-R operates with an independent safety gate, giving a dual-gate architecture. We formalize mission policies over robot traces, define security games, and prove authorization soundness, mission non-escalation, replay resistance, robot binding, provenance separation, threshold-approval security, audit-log tamper evidence, and trace-level composition. We report a preliminary cross-model evaluation with Claude Haiku~4.5 and the open-source Qwen2.5~7B planner. Across 240 live attack trials, the planners followed an injected mission deviation in 109 trials; AuthGuard-R rejected all 109 resulting unauthorized actions. A separate hand-constructed suite of eleven protocol- and policy-level attacks was also blocked completely.

PR本紙発行元 EmplifAI