何が起きたか

arxiv.orgに2026年2月3日付で掲載された論文「Reparameterization Flow Policy Optimization」において、RFOが提案された。RFOは、フローポリシーをRPGフレームワークに統合し、フロー生成過程とシステムダイナミクスを同時に逆伝播することで、対数尤度計算を不要としつつ高いサンプル効率を実現する。実験では、剛体・軟体、状態・視覚入力の多様なタスクで有効性が示され、特に軟体四足ロボットの制御タスクで最先端ベースラインの約2倍の報酬を達成したとされる。

詳細

論文は、従来のRPGアプローチがガウス分布ポリシーに限定されていた点を指摘し、フローポリシーが微分可能なODE積分を介して行動を生成するため、RPGフレームワークと自然に適合すると主張する。RFOは、フロー生成過程とシステムダイナミクスを介した勾配の逆伝播によりポリシー勾配を計算し、扱いにくい対数尤度計算を回避する。安定性と探索を向上させるための2つの正則化項を含み、アクションチャンキングを導入した変種も提案されている。実験は、剛体・軟体、状態・視覚入力の多様な移動・操作タスクで実施され、有効性が示された。

Key Facts

arxiv.orgに2026年2月3日付で論文「Reparameterization Flow Policy Optimization」が掲載された。[1]
RFOは、フロー生成過程とシステムダイナミクスを介してポリシー勾配を逆伝播し、対数尤度計算を不要とする。[1]
RFOは安定性と探索のための2つの正則化項を含み、アクションチャンキングを導入した変種も提案されている。[1]
実験は剛体・軟体、状態・視覚入力の多様な移動・操作タスクで実施された。[1]
軟体四足ロボットの制御タスクで、RFOは最先端ベースラインの約2倍の報酬を達成したと報告されている。[1]

なぜ重要か

本手法は、モデルベース強化学習におけるポリシー表現の制約を緩和し、生成モデルの進歩を活用する道を開く。これにより、複雑な物理シミュレーションや実ロボット制御におけるサンプル効率と性能の向上が期待される。特に、軟体ロボットなど従来困難だったタスクでの成果は、ロボティクス分野への応用可能性を示唆している。