何が起きたか
arXivに2025年11月13日付で掲載された論文(識別番号2511.10087v1)において、UEPO(Unified Expressive Policy Optimization)と呼ばれる統一生成フレームワークが提案された。UEPOは、オフラインからオンラインへの強化学習(O2O-RL)における、マルチモーダル行動の限定的なカバレッジとオンライン適応時の分布シフトという2つの根本的課題に対処する。D4RLベンチマークでは、移動タスクでUni-O4を絶対値で+5.9%、器用操作で+12.4%上回る性能を示した。
詳細
UEPOは、大規模言語モデルの事前学習とファインチューニング戦略に着想を得た統一生成フレームワークである。論文では3つの貢献が挙げられている。第1に、複数のモデルを訓練せずに多様なモダリティを効率的に捉えるマルチシード・ダイナミクス対応拡散ポリシー、第2に物理的に意味のあるポリシー多様性を強制する動的ダイバージェンス正則化メカニズム、第3にダイナミクスモデルの一般化を強化する拡散ベースのデータ拡張モジュールである。 O2O-RLは、安全で効率的なロボットポリシー展開の有望なパラダイムとして注目されているが、マルチモーダル行動の限定的なカバレッジとオンライン適応時の分布シフトという課題があった。UEPOはこれらの課題に対処し、D4RLベンチマークでの実験により、強い一般化とスケーラビリティを示したとしている。
Key Facts
| UEPOは、オフラインからオンラインへの強化学習(O2O-RL)の課題を解決する統一生成フレームワークである。 | [1] |
| UEPOは、大規模言語モデルの事前学習とファインチューニング戦略に着想を得ている。 | [1] |
| UEPOは、マルチシード・ダイナミクス対応拡散ポリシーを採用し、複数モデルの訓練なしで多様なモダリティを捉える。 | [1] |
| UEPOは、動的ダイバージェンス正則化メカニズムにより物理的に意味のあるポリシー多様性を強制する。 | [1] |
| UEPOは、拡散ベースのデータ拡張モジュールによりダイナミクスモデルの一般化を強化する。 | [1] |
| D4RLベンチマークで、UEPOは移動タスクでUni-O4を+5.9%上回った。 | [1] |
| D4RLベンチマークで、UEPOは器用操作でUni-O4を+12.4%上回った。 | [1] |
| 論文はarXivに2025年11月13日付で掲載された(識別番号2511.10087v1)。 | [1] |
なぜ重要か
UEPOは、ロボット学習におけるO2O-RLの実用性を高める可能性がある。D4RLベンチマークでの性能向上は、多様な行動獲得と分布シフトへの耐性が、実世界のロボット展開において重要であることを示唆している。