何が起きたか
2026年5月28日にarXivで公開された論文(識別番号2605.30660v1)で、BOKBO(Best of K Bad Options)と呼ばれる手法が提案された。これはVLAポリシーの推論時サンプリング(Kサンプリング)に対する初のコンフォーマル棄却層であり、実行違反率に関する有限標本・分布自由の保証を提供する。
詳細
BOKBOは、K個の候補行動チャンクをサンプリングし、検証器が最良と判断したものを実行する既存手法(RoboMonkey、SEAL、MG-Select、V-GPSなど)の問題に対処する。全候補が不安全な場合でも警告なしに違反行動を実行してしまうため、BOKBOは棄却層を追加し、実行違反率を制御する。グローバル版とタスク別(Mondrian)版があり、後者は最難タスクの条件付きギャップを縮小する。実験では、libero_object_temp_x0.1ベンチマークでOpenVLA-OFTを用い、ε=0.05のとき条件付きCRCバウンドがブートストラップ分割の86%で成立し、カバレッジ78%、正味タスク成功率70%を達成した。Mondrian-BOKBOはタスク別条件付きホールド率の最小値を0.71から0.93に引き上げた。5つの学習シードで安定し、π0-FASTでもブートストラップノイズ内で再現され、libero_spatial_temp_x0.1でも同等の結果が得られた。さらに、摂動ベースのKサンプリングでは、ベースポリシーの信頼度プロキシとKサンプルの不一致がアクションノイズハイパーパラメータσと0.98の相関を示す一方、実際の安全違反とはノイズフロアの相関しかないという構造的失敗を特定した。トークンレベルの温度サンプリングではこの失敗は部分的に緩和される。また、専門家レベルの操作力よりはるかに低いグローバルな力閾値は、不安全な行動と通常の操作を混同し、違反率を5倍に過大評価する方法論的落とし穴を特定し、修正した。
Key Facts
| BOKBOはVLAポリシーのKサンプル推論に対する初のコンフォーマル棄却層であり、実行違反率の有限標本・分布自由保証を提供する。 | 出典一覧 |
| BOKBOにはグローバル版とタスク別(Mondrian)版があり、後者は最難タスクの条件付きギャップを縮小する。 | 出典一覧 |
| libero_object_temp_x0.1でOpenVLA-OFTを用いた実験では、ε=0.05のとき条件付きCRCバウンドがブートストラップ分割の86%で成立し、カバレッジ78%、正味タスク成功率70%を達成した。 | 出典一覧 |
| Mondrian-BOKBOはタスク別条件付きホールド率の最小値を0.71から0.93に引き上げた。 | 出典一覧 |
| 摂動ベースのKサンプリングでは、ベースポリシーの信頼度プロキシとKサンプルの不一致がアクションノイズハイパーパラメータσと0.98の相関を示す一方、実際の安全違反とはノイズフロアの相関しかない。 | 出典一覧 |
本紙の見方
今回の提案は、VLAポリシーの推論時スケーリングにおける安全性保証の欠落を埋める点で新規性がある。既存のKサンプリング手法は性能向上に焦点を当てるが、全候補が不安全な場合の挙動を考慮しておらず、BOKBOはその隙間を埋める。本論文は、ポリシー内部の非コンフォーマルスコアが摂動ベースのKサンプリング下で構造的に失敗することを示し、これは安全クリティカルな応用において重要な知見である。また、力閾値の設定ミスが違反率を5倍に過大評価するという方法論的注意点は、今後のベンチマーク設計に影響を与える。業界構造への含意としては、VLAポリシーの実用化には安全性保証が不可欠であり、BOKBOのような棄却層はロボットの展開における信頼性向上に寄与する可能性がある。ただし、実験は特定のベンチマークとモデルに限定されており、実世界の多様な環境での有効性は未確認である。また、コンフォーマル予測の特性上、保証は周辺的であり、タスクごとの厳密な制御にはMondrian版が必要だが、その際のカバレッジと成功率のトレードオフが実用上の焦点になる。さらに、学習データの分布シフトに対する頑健性は4つのシフトで検証されているが、より広範なシフトでの挙動は今後の課題である。
なぜ重要か
VLAポリシーが実世界のロボットに展開される際、安全性の保証は必須である。BOKBOは、Kサンプリング推論における実行違反率を統計的に保証する枠組みを提供し、安全クリティカルな応用への道を開く。また、ポリシー内部のスコアリングの構造的失敗を明らかにしたことは、将来の安全対策設計に重要な示唆を与える。