何が起きたか
研究チームは2025年9月11日、arXivで「SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning」を公開した。このフレームワークはveRLを基盤に、VLA特有の軌道サンプリング、スケーラブルな並列化、マルチ環境レンダリング、最適化された損失計算を導入している。OpenVLA-OFTに適用した結果、LIBEROでSoTAを達成し、RoboTwin 1.0&2.0ではπ0を上回ったと報告している。
詳細
VLAモデルはロボット操作の強力なパラダイムとして登場したが、大規模な事前学習と教師あり微調整(SFT)にもかかわらず、SFTスケーリングに必要な大規模な人手によるロボット軌道の不足と、分布シフトを伴うタスクへの汎化の限界という2つの根本的な課題に直面している。近年の大規模推論モデル(LRM)の進展は、強化学習(RL)が段階的推論能力を劇的に向上させることを示しており、VLAの長期的な段階的行動計画にもRLが同様に有効かという疑問が生じている。 SimpleVLA-RLは、探索強化戦略を導入し、大規模データへの依存を減らしつつ堅牢な汎化を実現し、実世界のタスクでSFTを上回ったとしている。また、RLトレーニング中に「pushcut」と呼ばれる新現象を特定し、ポリシーが以前のトレーニングプロセスで見られなかったパターンを発見することを報告している。コードはGitHub(https://github.com/PRIME-RL/SimpleVLA-RL)で公開されている。
Key Facts
| SimpleVLA-RLはveRLを基盤とし、VLA特有の軌道サンプリング、スケーラブルな並列化、マルチ環境レンダリング、最適化された損失計算を導入している(ソース0) | [1] |
| OpenVLA-OFTに適用したSimpleVLA-RLは、LIBEROでSoTA性能を達成した(ソース0) | [1] |
| RoboTwin 1.0&2.0では、SimpleVLA-RLはπ0を上回った(ソース0) | [1] |
| SimpleVLA-RLは大規模データへの依存を減らし、堅牢な汎化を可能にし、実世界のタスクでSFTを上回った(ソース0) | [1] |
| RLトレーニング中に「pushcut」と呼ばれる新現象を特定し、ポリシーが以前のトレーニングプロセスで見られなかったパターンを発見することを報告した(ソース0) | [1] |
| コードはGitHub(https://github.com/PRIME-RL/SimpleVLA-RL)で公開されている(ソース0) | [1] |
なぜ重要か
VLAモデルの訓練における強化学習の有効性を示し、大規模データへの依存を減らす可能性がある。また、LIBEROやRoboTwinなどのベンチマークで高い性能を達成しており、ロボット操作の汎化性能向上に寄与すると期待される。