何が起きたか
2026年5月6日にarXivで公開された論文で、自動運転ポリシーのクローズドループ後訓練を目的としたCounterfactual-to-Interactive Reinforcement Fine-Tuning(CRAFT)が提案された。CRAFTは、オープンループ模倣学習で訓練されたポリシーを、クローズドループ環境で微調整するためのオン・ポリシーフレームワークである。
詳細
CRAFTは、クローズドループ後訓練をプロキシ残差最適化として定式化する。具体的には、グループ正規化された反実仮想アドバンテージを実クローズドループアドバンテージの密なプロキシとして用い、インタラクション臨界事象からの接地残差補正によりプロキシをクローズドループ世界に整合させる。さらに、EMA教師への非対称KL自己蒸留によりオンラインポリシーを正則化する。理論的には、実クローズドループポリシー勾配をプロキシ項と残差項に分解し、整合プロキシによる残差分散の低減と接地残差近似によるプロキシバイアスの緩和を実現する。実験では、Bench2Driveベンチマークで階層プランニング、視覚言語行動、語彙スコアリングの各アーキテクチャで最大のクローズドループ改善を達成したと報告されている。
Key Facts
| CRAFTは、クローズドループ後訓練をプロキシ残差最適化として定式化するオン・ポリシーフレームワークである。 | [1] |
| CRAFTは、グループ正規化された反実仮想アドバンテージを密なプロキシとして用い、インタラクション臨界事象からの接地残差補正でプロキシを整合させる。 | [1] |
| CRAFTは、EMA教師への非対称KL自己蒸留によりオンラインポリシーを正則化する。 | [1] |
| CRAFTは、Bench2Driveベンチマークで階層プランニング、視覚言語行動、語彙スコアリングの各アーキテクチャで最大のクローズドループ改善を達成したと報告されている。 | [1] |
| CRAFTの理論的枠組みは、実クローズドループポリシー勾配をプロキシ項と残差項に分解し、残差分散の低減とプロキシバイアスの緩和を実現する。 | [1] |
なぜ重要か
自動運転技術の実用化には、シミュレーションで訓練されたポリシーが実世界の複雑な状況で安全に動作することが不可欠である。CRAFTは、クローズドループ性能を向上させることで、そのギャップを埋める可能性を秘めており、自動運転システムの信頼性向上に寄与する。また、この手法は、反実仮想と強化学習の統合という点で、他のロボティクス分野にも応用が期待される。