日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
オフライン強化学習arXiv:2608.23939

CoDrift: オフライン強化学習のための合成的ドリフト

CoDrift: Compositional Drifting for Offline Reinforcement Learning

シェア:XThreadsFacebookLINEはてブBluesky

オフライン強化学習の複数の目的をアクション空間の運動場として捉え、それらを合成して一つの生成ポリシーを学習するフレームワークCoDriftを提案。73タスクで最先端手法と同等以上の性能を達成。

詳しい要約

1. どんなもの?

CoDriftは、オフライン強化学習(offline RL)のための生成的ポリシー学習フレームワークである。オフラインRLの本質的な多目的性(固定データセットの行動サポートへの適合と高価値行動の選択)を、行動空間上の運動場(motion field)として捉え、それらを合成(composition)することで統一的なポリシー場を構築する。3つの目的レベル場(条件付き場、周辺場、価値場)を組み合わせ、単一の順伝播で行動を生成する確率的生成器を学習する。

2. 先行研究と比べてどこがすごい?

従来のオフラインRL手法は、行動サポートへの制約と価値の最大化を別々に扱うことが多く、それらの目的を直接合成する枠組みはなかった。CoDriftは、異種の学習目的を運動場の合成として統一的に扱う点が新しい。また、連続制御のオフラインRLにおける単一正例サンプル(single-positive-sample)領域で、周辺場が状態をまたいで行動をプールすることで安定した生成信号を提供する点も独自性がある。

3. 技術・手法の肝は?

CoDriftは、3つの目的レベル場を合成する。条件付き場(conditional field)は状態依存の行動構造を保持し、周辺場(marginal field)は状態をまたいで行動をプールして安定した生成信号を提供し、価値場(value field)は行動を高価値領域へ移動させる。これらの場を合成して統一的なポリシー場を形成し、それを確率的生成器に吸収させる。生成器は展開時に単一の順伝播で行動を生成する。

4. どうやって有効だと検証した?

OGBenchとD4RLの73タスクにおいて、オフライン設定とオフラインからオンラインへの設定(offline-to-online)の両方で評価した。CoDriftは最先端手法と比較して良好な性能を示し、両設定で平均ランクが最良であった。

5. 議論はある?

要旨からは、CoDriftの限界や潜在的な欠点についての議論は不明である。また、運動場の合成が理論的にどのような保証を持つか、また大規模なタスクでのスケーラビリティについても言及がない。

6. 次に読むべき論文は?

要旨で参照されているOGBenchとD4RLのデータセット、および比較されたstate-of-the-art手法(具体的な名称は要旨にない)に関連する論文が挙げられる。また、オフラインRLの生成モデル(例えばDiffusion PolicyやCQL)や、運動場の概念に関連する研究(例えばNeural ODEやNormalizing Flow)も関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Xiewei Ni, Ruofeng Mei, Xiangyu Xu

分類: cs.LG, cs.RO

原文アブストラクト

Offline reinforcement learning is intrinsically multi-objective: a policy must remain compatible with the behavioral support of a fixed dataset while preferentially selecting high-value actions. We recast these objectives in a common form by viewing each as an action-space motion field that specifies how generated actions should move. This perspective enables heterogeneous learning objectives to be combined directly through field composition. Inspired by drifting models, we propose CoDrift, a compositional framework for one-step generative policy learning. CoDrift combines three objective-level fields into a unified policy field. The conditional field preserves state-dependent behavioral structure, while the marginal field pools actions across states to provide a more stable generative signal in the single-positive-sample regime of continuous-control offline RL. The value field moves generated actions toward higher-value regions. The composed field is absorbed into a stochastic generator that produces an action with a single forward pass at deployment. We evaluate CoDrift on 73 tasks from OGBench and D4RL in both offline and offline-to-online settings. CoDrift compares favorably with state-of-the-art methods and achieves the best average rank in both settings.

関連論文