何が起きたか
研究チームは2026-09-27、NAVSIM向けのGTRS-Denseラベル生成で、評価ルールが訓練ラベルを上書きしている実態を分析した。人間参照スコアが0のとき、公開版の生成器はシーン内の候補軌道16,384本をすべて通過扱いにしていた。チームはこの上書きを無効化して再実行し、103,288件のnavtrainシーンで公開ラベルと上書き前のターゲットを比較した。
詳細
NAVSIMの著者は、文脈上は妥当な操作を1本の軌道だけで採点する際に不利益を避けるため、この human-reference forgiveness を導入した一方、重要な失敗を見逃す可能性があると警告していたという。研究では、上書きルールが訓練損失の読み取る候補差を11,237件で消し、比率は10.8793%だった。 失敗の上書きは多くの列で大きな変化を伴い、車線維持では13,042本の forgiven loss columns のうち9,982本を占めた。車線維持で forgiven になった列では、上書き前に失敗していた候補の中央値は16,384本中14,391本だった。保留データのnavtestでは、車線維持で forgiven になったシーンに対し、公開された車線維持ヘッドのAUC中央値は上書き前の結果に対して0.7095、失敗候補数を合わせた unforgiven シーンでは0.9807だった。Hydra-MDPのチェックポイントでは、それぞれ0.6627と0.9761だった。
Key Facts
| NAVSIMのGTRS-Denseラベル生成では、人間参照スコアが0のとき、シーン内の16,384候補軌道をすべて通過扱いにしていた。 | [1] |
| 研究チームは上書きを無効化して、103,288件のnavtrainシーンで公開ラベルと上書き前のターゲットを比較した。 | [1] |
| 訓練損失が参照する候補の区別は11,237件で消え、比率は10.8793%だった。 | [1] |
| 車線維持では、13,042本の forgiven loss columns のうち9,982本を占めた。 | [1] |
| navtestでは、車線維持で forgiven になったシーンのAUC中央値が0.7095、unforgiven シーンでは0.9807だった。 | [1] |
本紙の見方
この論文の新しさは、NAVSIMの評価設計そのものが訓練ラベルを上書きしており、その影響を103,288件のシーンで定量化した点にある。単なる評価指標の議論ではなく、ラベル生成器が学習信号を直接変えていたことを、16,384候補という固定幅の候補集合に対して示したのが核心である。とくに11,237件、10.8793%という比率は、例外的な端数ではなく、学習データ全体の無視できない部分に影響が及んでいることを示す。 NAVSIMの著者が導入した human-reference forgiveness は、文脈的に妥当な操作を罰しないための仕組みである一方、研究チームの結果では、その仕組みが車線維持の訓練信号を大きく書き換えていた。9,982本が車線維持に集中していること、そして forgiven シーンでAUCが0.7095まで落ちる一方、失敗候補数を合わせた unforgiven シーンでは0.9807まで戻ることから、問題は単なる雑音ではなく、どの失敗を学習対象から外すかという設計の差にあるとみられる。Hydra-MDPでも0.6627と0.9761という同様の開きが出ており、配置やチェックポイントが違っても、同じラベルファイルを使う限り影響が連鎖する構図が見える。 業界構造への含意としては、データセットの評価ルールが、そのまま学習ラベルとモデル性能の解釈を左右する点が大きい。自動運転では、経路生成・採点・学習の各段階が分かれて見えても、実際には同じラベル定義が上流から下流まで浸透する。今回の結果は、評価上の「許容」が学習上の「正解」に転化する経路を可視化したものであり、今後はどの損失メトリクスで forgiveness が発動しているか、車線維持以外の挙動でも同じずれが起きるか、そして再学習で差が残るのかが確認点になる。EPDMSでは二つのターゲット集合を分けられなかったため、どの評価設計が差を生むのかも追加で見極める必要がある。
なぜ重要か
ラベル生成の上書きが学習信号を変えるなら、NAVSIMの結果を使う研究者は、モデルの性能差がアルゴリズム由来なのかラベル由来なのかを切り分ける必要がある。研究チームが示した0.7095対0.9807、0.6627対0.9761という開きは、評価設計の違いがそのまま学習結果に反映されることを示す。
日本への影響
日本でも自動運転の評価データや走行シナリオを扱う研究開発では、評価ルールが学習ラベルに及ぼす影響を点検する必要がある。特に、車線維持のような基本挙動で訓練信号が上書きされる設計は、モデル比較の前提を崩すため、データ作成と評価の分離が論点になる。