日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
強化学習arXiv:2610.02505

マルチフィデリティ方策勾配によるデータ希少強化学習の安定化

Multi-Fidelity Policy Gradients Stabilize Data-Scarce Reinforcement Learning

シェア:XThreadsFacebookLINEはてブBluesky

高忠実度データが少ない強化学習において、低忠実度データを制御変量として活用し、PPOに拡張したMFPG-PPOを提案。シミュレーションと実機で安定性とデータ効率を向上させた。

詳しい要約

1. どんなもの?

- 強化学習(RL)において、高忠実度(HF)データが少なく高コストな場合に、低忠実度(LF)データを活用して安定化させる手法。 - 特に、MFPGフレームワークを現代的なactor-critic学習(PPO)に拡張し、GPU並列シミュレーションと実機ロボットに適用。 - 提案手法MFPG-PPOは、HFデータのみで訓練したPPOよりも性能を向上させ、少ないHFデータで16倍のHFデータを用いたPPOに匹敵する。 - 実機Frankaアームで、更新あたり4エピソードのみの実ロボットデータで安定学習を実現。

2. 先行研究と比べてどこがすごい?

- 既存のLFデータ利用手法は、バイアスのある目的関数を直接最適化するものが多い。 - 対照的に、MFPGはLFデータを制御変量(control variate)としてのみ使用し、ポリシー勾配推定量にバイアスを生じさせずに分散を低減し、HFデータ効率を改善。 - しかし、公開されているMFPGの研究は小規模シミュレーションタスクでのREINFORCEに限定されていた。 - 本研究は、MFPGを現代的なactor-critic学習(PPO)に拡張し、GPU並列シミュレーションと実機ロボットに適用。 - ナイーブなPPO拡張はクロス忠実度相関を失うか分散を膨張させる可能性があるが、MFPG-PPOはこれを解決。

3. 技術・手法の肝は?

- MFPG-PPOは、サンプリング、アドバンテージ推定、制御変量構築を再設計し、クロス忠実度相関を保持。 - 推定量の不確実性を監視し、分散の膨張を防止。 - 固定サンプリング予算をHFデータとLFデータに配分するbudget-aware MFPG-PPOも導入。 - これにより、LFデータのバイアスを回避しつつ、HFデータの効率を向上。

4. どうやって有効だと検証した?

- シミュレーションロボットlocomotionタスクで、LFからHFへの転移難易度とHFデータ予算を変化させて評価。 - MFPG-PPOはほぼすべての設定でHFデータのみのPPOを上回り、最も難しいタスクで最小のHF予算でも16倍のHFデータで訓練したPPOに匹敵。 - ほとんどのLFデータ利用ベースラインは、直接的なLFからHFへの転移が成功する場合にのみ良好な性能を示す。 - 実機Frankaアームで、更新あたり4実ロボットエピソードのみ、人間のデモンストレーションなしで安定学習を実現。

5. 議論はある?

- ナイーブなPPO拡張はクロス忠実度相関を失うか分散を膨張させる可能性がある。 - MFPG-PPOはこれらの失敗を解決するが、LFデータの品質や転移難易度に依存する可能性がある。 - 実機実験では限られたエピソード数での安定学習を示したが、他のタスクやロボットへの一般化は今後の課題。 - 要旨からは、計算コストやスケーラビリティに関する議論は不明。

6. 次に読むべき論文は?

- MFPG(multi-fidelity policy gradient)の元論文(REINFORCEベース)。 - PPO(proximal policy optimization)の原論文。 - マルチ忠実度強化学習に関する研究(例:multi-fidelity RL, transfer learning)。 - 制御変量を用いた分散低減手法(control variates for policy gradients)。 - 実機ロボット学習におけるデータ効率化手法(例:sim-to-real transfer)。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Xinjie Liu, Ruihan Zhao, Anirban Chaudhuri, Cyrus Neary, Ufuk Topcu, David Fridovich-Keil

分類: cs.LG, cs.AI, cs.RO

原文アブストラクト

Policy gradient methods for on-policy reinforcement learning (RL) can become unstable when expensive, scarce target-domain data yield noisy gradient estimates. We address this challenge by complementing limited high-fidelity (HF) target-domain data with abundant, cheap, but biased low-fidelity (LF) data, e.g., from a simplified simulator. Most existing methods directly optimize biased objectives based on LF data. In contrast, the recently introduced multi-fidelity policy gradient (MFPG) framework uses LF data solely to construct a control variate that reduces variance and improves HF data efficiency without biasing the policy gradient estimator. However, published work on MFPG is limited to REINFORCE on small-scale simulation tasks. We develop MFPG for modern actor-critic learning in GPU-parallel simulation and on a physical robot. Our analysis and experiments show that naive extensions to proximal policy optimization (PPO) can lose cross-fidelity correlation or inflate variance. Our MFPG-PPO addresses these failures by redesigning the sampling, advantage estimation, and control variate construction to preserve cross-fidelity correlation, and by monitoring estimator uncertainty to prevent variance inflation. We also introduce a budget-aware MFPG-PPO to divide a fixed sampling budget among high- and low-fidelity data sources. Across simulated robot locomotion tasks of varying LF-to-HF transfer difficulty and HF data budgets, MFPG-PPO improves upon PPO trained on HF data alone in nearly all settings, and consistently matches the performance of PPO trained with 16x more HF data on the hardest task at the smallest HF budgets. In contrast, most baselines that use LF data perform well only where direct LF-to-HF transfer succeeds. MFPG-PPO enables stable learning on a physical Franka arm using only 4 real-robot episodes per update and no human demonstrations.

関連論文

PR本紙発行元 EmplifAI