何が起きたか
arXivに掲載された論文(2025年5月28日付)で、ReinFlowというオンライン強化学習(RL)フレームワークが提案された。ReinFlowは、連続ロボット制御のためのフローマッチングポリシー群を微調整する。Rectified FlowやShortcut Modelsなど、様々なフローモデル変種を、特に少数または1回のデノイジングステップで微調整できる。実験では、脚式移動タスクでRectified Flowポリシーのエピソード報酬が平均135.36%向上し、最先端の拡散RL微調整手法DPPOと比較してデノイジングステップを節約しつつ壁時間を82.63%削減した。また、状態ベースおよび視覚ベースの操作タスクでShortcut Modelポリシーの成功率が平均40.34%向上し、微調整済みDDIMポリシーと同等の性能を達成しながら平均23.20%の計算時間を節約した。
詳細
ReinFlowは、厳密なRL理論に基づいて設計されている。フローポリシーの決定論的経路に学習可能なノイズを注入し、フローを離散時間マルコフ過程に変換することで、正確かつ簡単な尤度計算を可能にする。この変換により探索が促進され、訓練の安定性が確保される。これにより、Rectified FlowやShortcut Modelsなど、多様なフローモデル変種を微調整できる。 実験では、視覚入力とスパース報酬を伴う長期的計画を含む、代表的な移動および操作タスクでベンチマークが行われた。脚式移動タスクでは、微調整後のRectified Flowポリシーのエピソード報酬が平均135.36%の純増加を示し、デノイジングステップを節約しつつ、最先端の拡散RL微調整手法DPPOと比較して壁時間を82.63%削減した。操作タスクでは、Shortcut Modelポリシーの成功率が、4回または1回のデノイジングステップで平均40.34%向上し、微調整済みDDIMポリシーと同等の性能を達成しながら、平均23.20%の計算時間を節約した。
Key Facts
| ReinFlowは、連続ロボット制御のためのフローマッチングポリシー群を微調整するオンライン強化学習フレームワークである。 | [1] |
| ReinFlowは、フローポリシーの決定論的経路に学習可能なノイズを注入し、フローを離散時間マルコフ過程に変換する。 | [1] |
| ReinFlowは、Rectified FlowやShortcut Modelsなど、多様なフローモデル変種を微調整できる。 | [1] |
| 脚式移動タスクで、Rectified Flowポリシーのエピソード報酬が平均135.36%向上した。 | [1] |
| ReinFlowは、最先端の拡散RL微調整手法DPPOと比較して、壁時間を82.63%削減した。 | [1] |
| 状態ベースおよび視覚ベースの操作タスクで、Shortcut Modelポリシーの成功率が平均40.34%向上した。 | [1] |
| Shortcut Modelポリシーは、4回または1回のデノイジングステップで微調整され、微調整済みDDIMポリシーと同等の性能を達成した。 | [1] |
| Shortcut Modelポリシーは、平均23.20%の計算時間を節約した。 | [1] |
なぜ重要か
ReinFlowは、フローマッチングポリシーをオンラインRLで微調整するための理論に基づいたフレームワークを提供し、拡散モデルベースのRLと比較して計算効率と性能の両方を向上させる可能性がある。これにより、ロボット制御におけるフローモデルの実用性が高まり、特にデノイジングステップが少ない状況での適用が期待される。