何が起きたか

2025年4月23日にarXivで公開された論文(識別番号2504.16680v3)において、研究チームは実機ロボット向けのオフラインMBRLパイプラインを提案した。提案手法RWM-Uは、自己回帰型世界モデルに認識的不確実性の推定を組み込み、長期的なロールアウトで不確実性を伝播させる。また、MOPO-PPOを組み合わせ、実世界制御向けに安定したオン方策PPOフレームワークで不確実性ペナルティ付き方策最適化を適用する。評価は、多様な操作・移動タスクをシミュレーションと実機の四足ロボット・ヒューマノイドで実施し、オフラインデータセットのみから方策を訓練した。

詳細

強化学習(RL)はロボット工学で顕著な成果を上げているが、高性能なパイプラインはタスク特異的で、過去のデータの再利用がほとんどない。オフラインMBRLは既存のデータセットのみから方策を訓練することでデータ効率を高めるが、長期的なロールアウトでは誤差の蓄積と分布シフトに悩まされる。既存手法は制御されたシミュレーションベンチマークでは成功しているが、実世界のロボットデータに典型的なノイズ、バイアス、部分観測に対して頑健に適用することは難しい。 提案手法は、RWM-UとMOPO-PPOを組み合わせる。RWM-Uは自己回帰型世界モデルに認識的不確実性の推定を追加し、時間的に一貫したマルチステップのロールアウトを可能にし、長期的な不確実性の伝播を実現する。MOPO-PPOは、不確実性ペナルティ付き方策最適化を、実世界制御向けの安定したオン方策PPOフレームワークに適応させる。 評価では、シミュレーションと実機の四足ロボット・ヒューマノイドで多様な操作・移動タスクを実施し、オフラインデータセットのみから方策を訓練した。結果として、提案手法はモデルフリーおよび不確実性を考慮しないモデルベースのベースラインを一貫して上回った。さらに、実世界データをモデル学習に統合することで、シミュレーションのみで訓練されたオンラインモデルフリーベースラインを上回る頑健な方策が得られた。

Key Facts

論文は2025年4月23日にarXivで公開された(識別番号2504.16680v3)。[1]
提案手法はRWM-Uと呼ばれ、自己回帰型世界モデルに認識的不確実性の推定を追加する。[1]
RWM-UはMOPO-PPOと組み合わされ、不確実性ペナルティ付き方策最適化をオン方策PPOフレームワークに適応させる。[1]
評価はシミュレーションと実機の四足ロボット・ヒューマノイドで実施された。[1]
方策はオフラインデータセットのみから訓練された。[1]
提案手法はモデルフリーおよび不確実性を考慮しないモデルベースのベースラインを一貫して上回った。[1]
実世界データをモデル学習に統合することで、シミュレーションのみで訓練されたオンラインモデルフリーベースラインを上回る頑健な方策が得られた。[1]

なぜ重要か

この研究は、実世界のロボットデータにおけるノイズやバイアス、部分観測といった課題に対処し、オフラインMBRLを実機で効果的に機能させるための原則的なパイプラインを提供する。これにより、ロボット学習におけるデータ再利用の可能性が広がり、シミュレーションと実機のギャップを縮小する可能性がある。