何が起きたか
2026年5月22日、arxiv.orgにプレプリント「Score-Based One-step MeanFlow Policy Optimization」が公開された。論文は、拡散モデルやフローマッチングをポリシーとして用いる強化学習において、複数ステップのデノイジングによる推論コストが課題であると指摘し、単一ステップで生成可能な「SOM」を提案している。
詳細
提案手法SOMは、アクター・クリティック型アルゴリズムであり、Q関数からスコア推定と確率フローODEを用いてターゲット速度場を直接構築する。これにより、オンラインRLでは入手が困難なターゲット分布からのサンプルを必要とせず、確率質量を高価値のモードに集中させる。実験では、完全オンラインRL設定のロコモーションタスクにおいて、単一生成ステップで最先端の性能を達成し、従来の拡散・フローマッチングベースのポリシーと比較して訓練・推論時間を大幅に削減したとしている。
Key Facts
| 論文「Score-Based One-step MeanFlow Policy Optimization」がarxiv.orgに2026年5月22日に公開された。 | [1] |
| SOMはアクター・クリティックアルゴリズムであり、Q関数からスコア推定と確率フローODEを用いてターゲット速度場を直接構築する。 | [1] |
| SOMは単一のネットワーク評価でノイズからデータを生成する(ワンステップ生成)。 | [1] |
| 完全オンラインRL設定のロコモーションタスクで最先端の性能を達成したと報告されている。 | [1] |
| 従来の拡散・フローマッチングベースのポリシーと比較して、訓練・推論時間を大幅に削減したとしている。 | [1] |
なぜ重要か
拡散・フローマッチングポリシーは表現力が高い一方で、推論コストが実用上の障害となっていた。SOMは単一ステップ生成を実現し、オンラインRLでの適用可能性を大きく広げるものであり、ロボット制御や自動運転などリアルタイム性が要求される分野への応用が期待される。今後の実証実験や他タスクへの拡張が注目される。