何が起きたか
研究チームは、推論ステップの有無が異なる3種類のVLAモデル(推論なし、テキスト連鎖思考、潜在反復ループ)を、LIBEROとSimplerEnv上で視覚・推論・行動の各段階に摂動を加えて評価した。その結果、潜在反復モデルは確率的ノイズとホワイトボックス摂動の両方でタスク成功率が崩壊し、他の2モデルは維持した。
詳細
研究チームは、推論設計がロバスト性を変えるか、推論を実行時に安全信号として読み取れるかの2つの問いを設定した。実験では、潜在反復モデルの脆弱性が累積的ではなく構造的であることを確認し、推論深度を変えても挙動はほとんど変わらなかった。また、推論出力の監視は原理的には可能だが、公正なテストでは失敗し、計画-行動整合性プローブは単純な評価ではほぼ完璧に見えるが、適応的攻撃下では偶然レベルに低下した。マッチドFPR較正では、行動異常プローブとの融合でも防御成功率は非防御時を上回らなかった。
Key Facts
| 研究チームは、推論ステップの有無が異なる3種類のVLAモデル(推論なし、テキスト連鎖思考、潜在反復ループ)を、LIBEROとSimplerEnv上で評価した。 | [1] |
| 潜在反復モデルは、確率的ノイズとホワイトボックス摂動の両方でタスク成功率が崩壊し、他の2モデルは維持した。 | [1] |
| 潜在反復モデルの脆弱性は構造的であり、推論深度を変えても挙動はほとんど変わらなかった。 | [1] |
| 計画-行動整合性プローブは単純な評価ではほぼ完璧に見えるが、適応的攻撃下では偶然レベルに低下した。 | [1] |
| マッチドFPR較正では、行動異常プローブとの融合でも防御成功率は非防御時を上回らなかった。 | [1] |
なぜ重要か
この研究は、VLAモデルに推論を組み込む際の設計指針に重要な示唆を与える。推論が必ずしもロバスト性を高めないという発見は、実ロボット応用での安全性確保に影響し、防御策の評価方法の再考を促す。