何が起きたか

arXivに掲載された論文(2025年12月31日付)で、拡散ポリシーのRL最適化を安定化する新アルゴリズムDIPOLEが提案された。DIPOLEは報酬最大化と最小化の二つのポリシーに分解し、推論時に線形結合することで貪欲さを制御する。オフラインおよびオフライン→オンライン設定のExORLとOGBenchで評価し、さらに大規模VLAモデルを自動運転タスクで訓練し、NAVSIMベンチマークで検証した。

詳細

DIPOLEは、KL正則化付きRL目的を再検討し、貪欲化されたポリシー正則化スキームを定式化する。これにより、最適ポリシーを報酬最大化と報酬最小化の二つの安定に学習されるポリシーに分解できる。推論時には、二つのポリシーのスコアを線形結合することで、貪欲さのレベルを柔軟に制御できる。既存手法は価値目的の直接最大化による不安定な訓練や、粗いガウス尤度近似による計算問題を抱えていたが、DIPOLEはこれらを回避する。評価はオフラインおよびオフライン→オンラインRL設定でExORLとOGBenchを用いて行われ、さらに大規模VLAモデルを自動運転タスクで訓練し、NAVSIMで評価した。

Key Facts

DIPOLEは、KL正則化付きRL目的を再検討し、貪欲化されたポリシー正則化スキームを定式化する。[1]
DIPOLEは最適ポリシーを報酬最大化と報酬最小化の二つのポリシーに分解し、推論時に線形結合する。[1]
DIPOLEはオフラインおよびオフライン→オンラインRL設定でExORLとOGBenchを用いて評価された。[1]
DIPOLEは大規模VLAモデルを自動運転タスクで訓練し、NAVSIMベンチマークで評価した。[1]

なぜ重要か

拡散ポリシーは表現力が高い一方で、RLによる訓練が不安定で実用化が難しかった。DIPOLEはその安定化を図る新手法であり、ロボット制御や自動運転など実世界の意思決定タスクへの応用を前進させる可能性がある。特に、大規模VLAモデルとの組み合わせは、今後の自動運転技術の発展に影響を与えるとみられる。