何が起きたか

研究チームは2026年8月17日、LLM駆動型身体化エージェントに対する新たな攻撃手法「Environment State-Text Injection (ESTI)」を発表した。ESTIは環境状態テキストを操作することで、ユーザー指示やモデルパラメータ、実行器を変更せずに、計画と実行の両方に影響を与える。評価では、既存の攻撃手法と比較して、計画レベルで最大89.32%、実行レベルで最大43.69%の攻撃成功率向上を達成した。

詳細

ESTIは、環境状態テキストを独立した攻撃面として扱い、敵対的目標を現在の環境と整合する偽の状態証拠として再構成する。これにより、オブジェクトの特性、空間関係、アフォーダンス、タスク段階ルール、実行フィードバックを通じて計画と実行に影響を与える。評価には、ProgPrompt/VirtualHome、VoxPoser/RLBench、AI2-THOR/iTHORの3つの環境が使用された。比較対象はVanilla IPI、EIRAD、BADROBOTで、ESTIはこれらを一貫して上回った。さらに、攻撃の伝播を評価するためのベンチマーク「ESTI-Bench」も開発された。分析により、接地性、一貫性、実行可能性が、操作された状態証拠が身体化された閉ループを伝播し、検証可能な環境変化を生み出すかどうかを決定することが示された。

Key Facts

ESTIは環境状態テキストを攻撃面とし、ユーザー指示、モデルパラメータ、実行器を変更しない。[1]
ESTIは計画レベルで最大89.32%、実行レベルで最大43.69%の攻撃成功率向上を達成した。[1]
評価にはProgPrompt/VirtualHome、VoxPoser/RLBench、AI2-THOR/iTHORが使用された。[1]
ESTI-Benchは攻撃の計画から実行への伝播を評価するために開発された。[1]
接地性、一貫性、実行可能性が攻撃の伝播を決定する要因として分析された。[1]

本紙の見方

本研究の新規性は、環境状態テキストを攻撃面として独立に扱った点にある。既存の攻撃はユーザー指示やプロンプト、モデル動作、知覚入力を操作するものが多く、環境状態テキスト自体が欺瞞的なタスク証拠となり得ることは十分に検討されていなかった。ESTIはこのギャップを埋めるもので、身体化エージェントのセキュリティ境界としてのプランナー可視状態表現に着目した点が新しい。 攻撃成功率の向上幅は大きく、計画レベルで最大89.32%、実行レベルで最大43.69%という数字は、環境状態テキストの操作が実行結果にまで影響を及ぼすことを示している。特に、実行レベルでの成功率向上は、計画の逸脱だけでは実行の成功を保証できないという身体化タスクの特性を考慮すると、攻撃が実際の環境変化を引き起こすことを意味し、深刻な脅威となる。 本研究は、身体化エージェントのセキュリティ研究において、環境状態テキストという新たな攻撃面を提示した。これは、LLM駆動エージェントの安全性を考える上で、プランナーが参照する状態表現の完全性を保護する必要性を示唆している。また、ESTI-Benchは攻撃の伝播を評価するための標準的なベンチマークとして、今後の研究の基盤となる可能性がある。 一方で、本研究はシミュレーション環境での評価に留まっており、実世界のロボットでの有効性や、防御策の検討は今後の課題である。また、攻撃の成功率は環境やタスクによって変動する可能性があり、より多様な環境での評価が求められる。

なぜ重要か

LLM駆動型身体化エージェントが実世界で活用されるにつれ、そのセキュリティは重要な課題となる。本研究は、環境状態テキストという新たな攻撃面を明らかにし、既存の防御策が想定していない脅威を浮き彫りにした。これは、エージェントの安全性を確保するために、状態表現の完全性を保護する新たな対策が必要であることを示している。