何が起きたか
arXivに2026年3月13日付で公開された論文『Altered Thoughts, Altered Actions: Probing Chain-of-Thought Vulnerabilities in VLA Robotic Manipulation』は、CoT推論を採用するVLAモデルに対し、中間の自然言語プランを改変する攻撃を設計した。40のLIBEROテーブルトップ操作タスクで評価した結果、物体名の置換で成功率が平均8.3ポイント、目標条件付きタスクで19.3ポイント、個別タスクで最大45ポイント低下した。
詳細
研究チームは、推論モジュールと行動デコーダの間のテキストチャネルに着目し、7種類のテキスト改変を3つの攻撃階層(ブラインドノイズ、機械的意味、LLM適応)に分類した。実験では、最先端の推論型VLAと非推論型VLAを比較し、物体名の置換が最も効果的であることを確認した。一方、文の並べ替え、空間方向の反転、トークンノイズ、70BパラメータのLLMによるもっともらしい誤プランは、いずれも±4ポイント以内の影響にとどまった。
Key Facts
| 物体名の置換により、全体の成功率が8.3ポイント低下し、目標条件付きタスクでは19.3ポイント、個別タスクでは最大45ポイント低下した。 | [1] |
| 文の並べ替え、空間方向の反転、トークンノイズ、70BパラメータのLLMによる誤プランは、いずれも±4ポイント以内の影響だった。 | [1] |
| 非推論型VLAを対照とした実験で、この脆弱性は推論型モデルに特有であることが確認された。 | [1] |
| 研究は40のLIBEROテーブルトップ操作タスクで評価された。 | [1] |
| 論文は2026年3月13日にarXivで公開された。 | [1] |
なぜ重要か
この研究は、ロボット操作AIの新たな脆弱性を明らかにし、CoT推論を採用するシステムの安全性設計に警鐘を鳴らす。物理的な行動を伴うAIにとって、内部推論の改変は入力検証をすり抜けるため、実運用時のリスク評価に重要な示唆を与える。