何が起きたか

2026年3月29日、arXivにプレプリント「FlowRL: A Taxonomy and Modular Framework for Reinforcement Learning with Diffusion Policies」が公開された。拡散・フローモデルを政策とするRLアルゴリズムの分類体系と、JAXベースのオープンソースコードベースを提案している。

詳細

論文は、拡散・フローモデルを政策表現として用いるRLアルゴリズムを統一的に整理する分類体系を導入する。また、JITコンパイルを活用した高スループットな学習を実現するJAXベースのモジュール型コードベースを提供し、Gym-Locomotion、DeepMind Control Suite、IsaacLabでの標準化ベンチマークを通じて拡散ベース手法の比較とアルゴリズム選択の指針を示す。コードはhttps://github.com/typoverflow/flow-rlで公開されている。

Key Facts

論文「FlowRL: A Taxonomy and Modular Framework for Reinforcement Learning with Diffusion Policies」がarXivで公開された(2026年3月29日)。[1]
拡散・フローモデルを政策とするRLアルゴリズムの分類体系を導入する。[1]
JAXベースのモジュール型オープンソースコードベースを提供し、JITコンパイルで高スループットな学習を実現する。[1]
Gym-Locomotion、DeepMind Control Suite、IsaacLabでの標準化ベンチマークを提供する。[1]
コードはhttps://github.com/typoverflow/flow-rlで公開されている。[1]

なぜ重要か

拡散・フローモデルを政策とするRLは、ロボティクスや生成モデルの応用で注目を集めるが、手法の多様性ゆえに比較や再現が困難だった。FlowRLは分類体系と標準化ベンチマークを提供することで、研究の進展を加速し、実務者が適切な手法を選ぶための基盤を築く。