日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2610.09943

成功への多様な道:VLA汎化のための多様性駆動型RLファインチューニング

Many Ways to Succeed: Diversity-Driven RL Fine-Tuning for VLA Generalization

シェア:XThreadsFacebookLINEはてブBluesky

VLA方策のRLファインチューニングにおいて、成功軌道の多様性を明示的な報酬として組み込むDRIVEを提案し、分布シフト下での汎化性能を向上させた。

詳しい要約

1. どんなもの?

- VLA policyのRL fine-tuningにおける一般化を改善する手法 - DRIVE (Diversity-driven RL fIne-tuning for VLA gEneralization) を提案 - RL fine-tuningはclosed-loop experienceでVLAを改善するが、fine-tuning分布外への一般化は限定的 - 分析により、RLは探索を選択的に再形成し、成功軌道の多様性を高め、より少ないrolloutで成功を引き出し、latent task-valid solution spaceのより広い範囲をカバーすることを示す - この成功モードの広いカバレッジが分布シフト下での代替戦略を提供しうるという着想に基づく - 成功行動の多様性を明示的なRL目的に組み込む

2. 先行研究と比べてどこがすごい?

- 従来のRL fine-tuningはfine-tuning分布外への一般化が限定的 - supervised fine-tuningと比較して、RLは成功軌道の多様性を高め、より少ないrolloutで成功を引き出し、latent task-valid solution spaceをより広くカバーすることを分析で示す - DRIVEは成功行動の多様性を明示的なRL目的とすることで、vanilla RL fine-tuningよりOOD性能を改善 - LIBERO-Plus, ManiSkill3, RoboTwin 2.0でπ0で+5.3点、π0.5で+2.0点 - 実機dual-arm AgileX PiPER-XでOOD成功率64.1%→73.3% (+9.2点)

3. 技術・手法の肝は?

- 成功行動の多様性を明示的なRL目的に変換 - 同一タスク条件下のrolloutをグループ化 - 時間的アラインメントで軌道を比較 - 相対的な行動多様性から成功条件付きintrinsic rewardを導出 - この設計により、多様な失敗や表面的なタイミングの違いに報酬を与えず、実行可能解のより広いカバレッジを促す

4. どうやって有効だと検証した?

- LIBERO-Plus, ManiSkill3, RoboTwin 2.0のベンチマークで評価 - vanilla RL fine-tuningと比較してOOD性能を改善 - π0で平均+5.3点、π0.5で平均+2.0点 - 実機dual-arm AgileX PiPER-Xプラットフォームで平均OOD成功率が64.1%から73.3%へ増加 (+9.2点) - 物理展開下でも改善が持続することを実証

5. 議論はある?

- 要旨からは不明 - ただし、成功モードの広いカバレッジが分布シフト下での代替戦略を提供しうるという議論が示唆されている

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究: vanilla RL fine-tuning, supervised fine-tuning - 関連手法: π0, π0.5 (VLA policies) - ベンチマーク: LIBERO-Plus, ManiSkill3, RoboTwin 2.0 - ハードウェア: AgileX PiPER-X - 同分野の定番: vision-language-action (VLA) policies, reinforcement learning (RL) fine-tuning

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Haoru Li, Jinmei Liu, Zhiyong Wang, Xiaoming Li, Zhenhong Sun, Daoyi Dong, Chunlin Chen, Zhi Wang

分類: cs.RO, cs.LG

原文アブストラクト

Reinforcement learning (RL) fine-tuning improves vision-language-action (VLA) policies through closed-loop experience, yet generalization beyond the fine-tuning distribution remains limited. Our analysis reveals a selective reshaping of exploration: RL contracts behavior globally, yet diversifies successful trajectories, elicits success with fewer rollouts, and covers more of the latent task-valid solution space than supervised fine-tuning. Broader successful-mode coverage may provide alternative strategies under distribution shifts. Inspired by this, we introduce DRIVE (Diversity-driven RL fIne-tuning for VLA gEneralization), which turns successful-behavior diversity into an explicit RL objective. DRIVE groups rollouts under matched task conditions, compares their trajectories with temporal alignment, and derives a success-conditioned intrinsic reward from relative behavioral diversity. This design encourages broader coverage of feasible solutions without rewarding diverse failures or superficial timing differences. Across LIBERO-Plus, ManiSkill3, and RoboTwin 2.0, DRIVE improves the average out-of-domain (OOD) performance over vanilla RL fine-tuning by 5.3 points on $π_0$ and 2.0 points on $π_{0.5}$. On a dual-arm AgileX PiPER-X platform, DRIVE further increases average OOD success from 64.1% to 73.3% (+9.2 points), demonstrating gains that persist under physical deployment.

関連論文

PR本紙発行元 EmplifAI