何が起きたか
自律システムの実世界での障害発見を効率化する適応的手法が提案された。プロキシ評価と限られた実機結果を組み合わせ、障害が起きやすい多様なシナリオを選択する。自動運転、操作、四足歩行の速度追従タスクで、ランダムサンプリングや能動学習と比べ最大2倍の障害を発見した。
詳細
自律システムはまれで多様な形で障害を起こすため、限られたテスト予算での実世界の障害発見は困難である。シミュレータや低忠実度システム、関連するポリシーなどの安価なプロキシは広範囲にサンプリングして障害を見つけるために使えるが、プロキシの障害はシミュレーションから実世界へのギャップやシステム間のギャップにより、実世界に転移しないことが多い。 提案手法は、プロキシ評価と限られたターゲットシステムの結果を組み合わせ、ターゲットシステムのテストのためのシナリオ選択を導く適応的障害発見手法である。制御変量に着想を得た残差モデリングを用いてプロキシの障害信号を補正し、ターゲットのリスクの局所予測器を学習する。 可能性が高く多様な障害を見つけるため、この予測器をサポートを考慮した相互情報量の目的関数と組み合わせ、現実的で十分にサポートされた領域を優先しつつ、障害モード全体のカバレッジを拡大する。自動運転、操作、四足歩行の速度追従タスクにおいて、この手法はランダムサンプリングや能動学習のベースラインと比較して最大2倍の障害を発見し、競合手法が見逃す深刻で多様な障害も含むとしている。
Key Facts
| 自律システムはまれで多様な形で障害を起こすため、限られたテスト予算での実世界の障害発見は困難である。 | [1] |
| シミュレータや低忠実度システム、関連するポリシーなどの安価なプロキシは広範囲にサンプリングして障害を見つけるために使える。 | [1] |
| プロキシの障害はシミュレーションから実世界へのギャップやシステム間のギャップにより、実世界に転移しないことが多い。 | [1] |
| 提案手法は、プロキシ評価と限られたターゲットシステムの結果を組み合わせ、ターゲットシステムのテストのためのシナリオ選択を導く適応的障害発見手法である。 | [1] |
| 制御変量に着想を得た残差モデリングを用いてプロキシの障害信号を補正し、ターゲットのリスクの局所予測器を学習する。 | [1] |
| サポートを考慮した相互情報量の目的関数を組み合わせ、現実的で十分にサポートされた領域を優先しつつ、障害モード全体のカバレッジを拡大する。 | [1] |
| 自動運転、操作、四足歩行の速度追従タスクにおいて、この手法はランダムサンプリングや能動学習のベースラインと比較して最大2倍の障害を発見した。 | [1] |
| 競合手法が見逃す深刻で多様な障害も含むとしている。 | [1] |
なぜ重要か
この手法は、限られたテスト予算で実世界の障害を効率的に発見することを可能にし、自律システムの信頼性向上に貢献する。プロキシ情報を活用することで、実機テストのコストを抑えつつ、多様で深刻な障害を検出できる可能性がある。