何が起きたか
拡散型の視覚言語行動(VLA)ポリシーは、タスクを定義する視覚・言語の証拠に予測が弱く基づいている場合でも、もっともらしい行動を生成できる。この問題に対処するため、GUARD(Grounding Uncertainty and Ablation-Based Risk Detection)と呼ばれるテスト時故障検出法が提案された。GUARDは事前学習済みポリシーを変更せずに、この根拠の欠如を測定する。具体的には、最終的な視覚言語モデルのキー・バリュー(KV)キャッシュ内のトークン索引エントリの影響を推定し、顕著なKVエントリを除去した反事実キャッシュを構築し、そのノイズ除去応答を元の条件付けと比較する。この比較に基づき、感度、注意エントロピー、モダリティバイアス、根拠効率を含むGUARD診断ストリームを導出し、オンラインで較正して軽量な時系列分類器で処理する。GUARDは、Pi0、SmolVLA、Alpamayo-1.5をLIBERO、SimplerEnv、MetaWorld、PhysicalAI-AVで評価した。その結果、5つの未学習タスク設定のうち4つで最高のROC-AUCを達成し、残りの1設定で2位となった。平均未学習タスクROC-AUCは、最も強力な競合ランタイムモニターと比較して5.73パーセントポイント向上し、最良の学習済みタスク平均には0.19ポイント差に留まった。
Key Facts
| GUARDは拡散型VLAポリシーのテスト時故障検出法であり、事前学習済みポリシーを変更しない。 | [0] |
| GUARDは最終的な視覚言語モデルのKVキャッシュ内のトークン索引エントリの影響を推定し、顕著なKVエントリを除去した反事実キャッシュを構築して、ノイズ除去応答を元の条件付けと比較する。 | [0] |
| GUARDは感度、注意エントロピー、モダリティバイアス、根拠効率を含む診断ストリームを導出し、オンラインで較正して軽量な時系列分類器で処理する。 | [0] |
| GUARDはPi0、SmolVLA、Alpamayo-1.5をLIBERO、SimplerEnv、MetaWorld、PhysicalAI-AVで評価した。 | [0] |
| GUARDは5つの未学習タスク設定のうち4つで最高のROC-AUCを達成し、残りの1設定で2位となった。 | [0] |
| GUARDは平均未学習タスクROC-AUCを最も強力な競合ランタイムモニターと比較して5.73パーセントポイント向上させ、最良の学習済みタスク平均には0.19ポイント差に留まった。 | [0] |
なぜ重要か
拡散型VLAポリシーは、視覚・言語の証拠に弱く基づく予測でももっともらしい行動を生成する可能性があり、実世界での信頼性が課題となる。GUARDは事前学習済みポリシーを変更せずにテスト時に故障を検出できるため、ロボットや物理AIシステムの安全性向上に寄与する可能性がある。未学習タスクでのROC-AUC向上は、汎化性能の高い故障検出の実現を示唆している。