何が起きたか

arXivに2026年3月13日付で公開された論文『Altered Thoughts, Altered Actions: Probing Chain-of-Thought Vulnerabilities in VLA Robotic Manipulation』は、CoT推論を採用するVLAモデルに対し、中間の自然言語プランを改変する攻撃を設計した。40のLIBEROテーブルトップ操作タスクで評価した結果、物体名の置換で成功率が平均8.3ポイント、目標条件付きタスクで19.3ポイント、個別タスクで最大45ポイント低下した。

詳細

研究チームは、推論モジュールと行動デコーダの間のテキストチャネルに着目し、7種類のテキスト改変を3つの攻撃階層(ブラインドノイズ、機械的意味、LLM適応)に分類した。実験では、最先端の推論型VLAと非推論型VLAを比較し、物体名の置換が最も効果的であることを確認した。一方、文の並べ替え、空間方向の反転、トークンノイズ、70BパラメータのLLMによるもっともらしい誤プランは、いずれも±4ポイント以内の影響にとどまった。

Key Facts

物体名の置換により、全体の成功率が8.3ポイント低下し、目標条件付きタスクでは19.3ポイント、個別タスクでは最大45ポイント低下した。出典一覧
文の並べ替え、空間方向の反転、トークンノイズ、70BパラメータのLLMによる誤プランは、いずれも±4ポイント以内の影響だった。出典一覧
非推論型VLAを対照とした実験で、この脆弱性は推論型モデルに特有であることが確認された。出典一覧
研究は40のLIBEROテーブルトップ操作タスクで評価された。出典一覧
論文は2026年3月13日にarXivで公開された。出典一覧

本紙の見方

今回の研究は、VLAモデルのCoT推論が新たな攻撃面となることを実証した点で新規性がある。従来の入力改変とは異なり、内部の推論トレースのみを改変するため、入力検証では防御できない。特に、物体名の置換が効果的である一方、LLMによるもっともらしい誤プランが効果を持たないという非対称性は、行動デコーダが推論の質ではなく物体参照の整合性に依存していることを示唆する。これは、VLAの設計において、推論と行動の間の情報伝達を保護する必要性を浮き彫りにする。業界への含意として、ロボット操作の安全性を高めるには、推論トレースの整合性検証や、攻撃耐性のあるデコーダ設計が求められる。未確定の論点としては、実環境での攻撃の実現可能性や、他のVLAアーキテクチャへの影響が挙げられる。

なぜ重要か

この研究は、ロボット操作AIの新たな脆弱性を明らかにし、CoT推論を採用するシステムの安全性設計に警鐘を鳴らす。物理的な行動を伴うAIにとって、内部推論の改変は入力検証をすり抜けるため、実運用時のリスク評価に重要な示唆を与える。