何が起きたか
2026年5月28日にarXivで公開された論文(識別番号2605.30660v1)で、BOKBO(Best of K Bad Options)と呼ばれる手法が提案された。これはVLAポリシーの推論時サンプリング(Kサンプリング)に対する初のコンフォーマル棄却層であり、実行違反率に関する有限標本・分布自由の保証を提供する。
詳細
BOKBOは、K個の候補行動チャンクをサンプリングし、検証器が最良と判断したものを実行する既存手法(RoboMonkey、SEAL、MG-Select、V-GPSなど)の問題に対処する。全候補が不安全な場合でも警告なしに違反行動を実行してしまうため、BOKBOは棄却層を追加し、実行違反率を制御する。グローバル版とタスク別(Mondrian)版があり、後者は最難タスクの条件付きギャップを縮小する。実験では、libero_object_temp_x0.1ベンチマークでOpenVLA-OFTを用い、ε=0.05のとき条件付きCRCバウンドがブートストラップ分割の86%で成立し、カバレッジ78%、正味タスク成功率70%を達成した。Mondrian-BOKBOはタスク別条件付きホールド率の最小値を0.71から0.93に引き上げた。5つの学習シードで安定し、π0-FASTでもブートストラップノイズ内で再現され、libero_spatial_temp_x0.1でも同等の結果が得られた。さらに、摂動ベースのKサンプリングでは、ベースポリシーの信頼度プロキシとKサンプルの不一致がアクションノイズハイパーパラメータσと0.98の相関を示す一方、実際の安全違反とはノイズフロアの相関しかないという構造的失敗を特定した。トークンレベルの温度サンプリングではこの失敗は部分的に緩和される。また、専門家レベルの操作力よりはるかに低いグローバルな力閾値は、不安全な行動と通常の操作を混同し、違反率を5倍に過大評価する方法論的落とし穴を特定し、修正した。
Key Facts
| BOKBOはVLAポリシーのKサンプル推論に対する初のコンフォーマル棄却層であり、実行違反率の有限標本・分布自由保証を提供する。 | [1] |
| BOKBOにはグローバル版とタスク別(Mondrian)版があり、後者は最難タスクの条件付きギャップを縮小する。 | [1] |
| libero_object_temp_x0.1でOpenVLA-OFTを用いた実験では、ε=0.05のとき条件付きCRCバウンドがブートストラップ分割の86%で成立し、カバレッジ78%、正味タスク成功率70%を達成した。 | [1] |
| Mondrian-BOKBOはタスク別条件付きホールド率の最小値を0.71から0.93に引き上げた。 | [1] |
| 摂動ベースのKサンプリングでは、ベースポリシーの信頼度プロキシとKサンプルの不一致がアクションノイズハイパーパラメータσと0.98の相関を示す一方、実際の安全違反とはノイズフロアの相関しかない。 | [1] |
なぜ重要か
VLAポリシーが実世界のロボットに展開される際、安全性の保証は必須である。BOKBOは、Kサンプリング推論における実行違反率を統計的に保証する枠組みを提供し、安全クリティカルな応用への道を開く。また、ポリシー内部のスコアリングの構造的失敗を明らかにしたことは、将来の安全対策設計に重要な示唆を与える。