日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLA/失敗検出arXiv:2608.04510v1

GUARD: 拡散型VLAのための不確実性とアブレーションに基づくリスク検出

GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAs

シェア:XThreadsFacebookLINEはてブBluesky

拡散型視覚言語行動ポリシーが視覚・言語の証拠に弱く基づく予測を行う際の失敗を、テスト時に検出する手法GUARDを提案。事前学習済みポリシーを変更せず、KVキャッシュのアブレーションによる反実仮想比較からリスク指標を導出する。

詳しい要約

1. どんなもの?

GUARDは、拡散ベースのvision-language-action (VLA)ポリシーに対するテスト時失敗検出手法である。事前学習済みポリシーを変更せずに、視覚と言語の証拠に対する行動予測の接地(grounding)の弱さを測定する。具体的には、最終のvision-language modelのkey-value (KV) cacheにおけるトークンインデックス項目の影響を推定し、顕著なKV項目を除去した反事実キャッシュを構築して、元の条件付けとデノイジング応答を比較する。これにより、感度、注意エントロピー、モダリティバイアス、接地効率を含む診断ストリームを導出し、オンラインで較正して軽量な時間分類器で処理する。

2. 先行研究と比べてどこがすごい?

先行研究の失敗検出は、行動の不確実性や予測誤差に基づくものが多いが、GUARDは行動生成時の視覚・言語証拠への依存度を直接プローブする点が新しい。事前学習ポリシーを変更せずに、KV cacheのアブレーションによる反事実比較で接地を定量化するため、ポリシー非依存で転移可能な失敗信号を提供する。また、複数のベンチマークとポリシーにわたって一貫した性能向上を示し、既存のランタイムモニタと比較して優れたROC-AUCを達成している。

3. 技術・手法の肝は?

手法の核心は、KV cacheのトークンインデックス項目の影響を推定し、顕著な項目をアブレーションした反事実キャッシュを構築して、元の条件付けとデノイジング応答を比較することにある。この比較から、感度、注意エントロピー、モダリティバイアス、接地効率の4つの診断ストリームを導出する。これらのストリームはオンラインで較正され、軽量な時間分類器(temporal classifier)に入力されて失敗を検出する。事前学習ポリシーは変更せず、テスト時のみに動作する。

4. どうやって有効だと検証した?

検証は、5つのポリシーベンチマーク設定(LIBERO, SimplerEnv, MetaWorld, PhysicalAI-AV)で、Pi0, SmolVLA, Alpamayo-1.5の3つのポリシーを用いて、タスクを分割した設定(task-held-out)で行われた。その結果、5つの未見タスク設定のうち4つで最高のROC-AUCを達成し、残りの1つで2位となった。平均未見タスクROC-AUCは、最強の競合ランタイムモニタより5.73パーセントポイント向上し、既知タスク平均では最良から0.19ポイント以内に留まった。

5. 議論はある?

要旨からは、議論の詳細は不明であるが、提案手法がポリシー、タスク、身体性、ドメインを横断して転移可能な失敗信号を提供することを示している。また、既知タスクと未見タスクの間で性能のトレードオフがある可能性が示唆される(既知タスク平均で最良に0.19ポイント差)。さらに、診断ストリームの解釈可能性や、時間分類器の設計に関する議論が考えられるが、要旨には明記されていない。

6. 次に読むべき論文は?

要旨で参照されている研究は、Pi0, SmolVLA, Alpamayo-1.5などのVLAポリシー、およびLIBERO, SimplerEnv, MetaWorld, PhysicalAI-AVなどのベンチマークである。次に読むべき論文としては、これらのVLAポリシーの元論文や、拡散モデルに基づく行動生成の研究、またテスト時失敗検出の関連研究(例:不確実性推定に基づく手法)が挙げられる。具体的には、Pi0の論文や、拡散ポリシーの失敗検出に関する最近の研究が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Suhas Hegde, Jitendra Yasaswi Bharadwaj Katta

分類: cs.RO, cs.AI

原文アブストラクト

Diffusion-based vision-language-action (VLA) policies can generate plausible actions even when their predictions are weakly grounded in the visual and language evidence defining the task. We introduce GUARD, a test-time failure detection method that measures this grounding without modifying the pretrained policy. GUARD estimates the influence of token-indexed entries in the final vision-language model key-value (KV) cache, constructs counterfactual caches by ablating salient KV entries, and compares their denoising responses with the original conditioning. Based on the comparison, we derive GUARD diagnostic stream including sensitivity, attention entropy, modality bias, and grounding efficiency, which are calibrated online and processed by a lightweight temporal classifier. We evaluate GUARD under task-held-out splits across five policy-benchmark settings, using Pi0, SmolVLA, and Alpamayo-1.5 on LIBERO, SimplerEnv, MetaWorld, and PhysicalAI-AV. GUARD achieves the best ROC-AUC on four of five unseen-task settings and ranks second on the remaining setting, improving the average unseen-task ROC-AUC by 5.73 percentage points over the strongest competing runtime monitor while remaining within 0.19 points of the best seen-task average. These results show that directly probing action-head dependence on multimodal evidence provides a transferable failure signal across policies, tasks, embodiments, and domains.