何が起きたか
arXivに2025年5月24日付で公開された論文(ID: 2505.18763v4)において、GenPO(Generative Policy Optimization)と名付けられたフレームワークが提案された。GenPOは、拡散ベースのポリシーをオンライン強化学習(PPOなど)に統合するもので、正確な拡散反転を利用して可逆なアクション写像を構築し、新規の二重ダミーアクション機構により対数尤度計算の障壁を解決する。実験では、脚式移動(Ant、Humanoid、Anymal-D、Unitree H1、Go2)、器用操作(Shadow Hand)、空中制御(Quadcopter)、ロボットアーム(Franka)を含む8つのIsaacLabベンチマークで、既存のRLベースラインに対する優位性が示された。
詳細
強化学習(RL)の最近の進歩により、生成拡散ベースのポリシーは強力な探索能力と多峰性を示している。しかし、オフラインRLやオフポリシーRLでの進展に比べ、拡散ポリシーをPPOのようなオンポリシーフレームワークに統合する試みは未開拓のままであった。このギャップは、オンポリシーRLアルゴリズム向けに最適化され、複雑なロボットタスクの高速トレーニングを可能にするIsaacLabのような大規模並列GPUアクセラレータシミュレータの普及を考えると特に重要である。 拡散ポリシー下での状態-行動対数尤度の計算は、ガウスポリシーでは簡単であるが、フローベースモデルでは不可逆な順方向・逆方向プロセスや離散化誤差(例:Euler-Maruyama近似)により扱いが難しい。GenPOは、正確な拡散反転を利用して可逆なアクション写像を構築し、交互更新による可逆性を可能にする二重ダミーアクション機構を導入することで、この問題を解決する。さらに、行動対数尤度を不偏のエントロピーおよびKLダイバージェンス推定に使用し、オンポリシー更新におけるKL適応学習率とエントロピー正則化を可能にする。 著者らは、GenPOが拡散ポリシーをオンポリシーRLに統合した最初の手法であり、大規模並列トレーニングと実世界のロボット展開の可能性を開くと主張している。
Key Facts
| GenPOは、拡散モデルベースのポリシーをオンライン強化学習(PPOなど)に統合するフレームワークである。 | [1] |
| GenPOは、正確な拡散反転を利用して可逆なアクション写像を構築する。 | [1] |
| GenPOは、二重ダミーアクション機構を導入し、交互更新による可逆性を実現する。 | [1] |
| GenPOは、行動対数尤度を不偏のエントロピーおよびKLダイバージェンス推定に使用する。 | [1] |
| 実験は、IsaacLabの8つのベンチマークで実施された。 | [1] |
| ベンチマークには、脚式移動(Ant、Humanoid、Anymal-D、Unitree H1、Go2)、器用操作(Shadow Hand)、空中制御(Quadcopter)、ロボットアーム(Franka)が含まれる。 | [1] |
| GenPOは、既存のRLベースラインよりも優れた性能を示した。 | [1] |
| 著者らは、GenPOが拡散ポリシーをオンポリシーRLに統合した最初の手法であると主張している。 | [1] |
| 論文はarXivに2025年5月24日付で公開された(ID: 2505.18763v4)。 | [1] |
なぜ重要か
GenPOは、拡散ポリシーをオンポリシー強化学習に統合する際の対数尤度計算の障壁を解決し、大規模並列トレーニングと実世界のロボット展開への道を開く可能性がある。これにより、複雑なロボットタスクの学習効率と性能が向上することが期待される。