何が起きたか
中国科学院の研究チームは、VLAモデル向けの分散非同期強化学習フレームワーク「AcceRL」を発表した。arXivに掲載された論文(2026年3月19日付)によると、同期型ベースラインと比較してスループットが2.4倍、LIBERO-Spatialタスクではサンプル効率が最大200倍向上したとしている。
詳細
AcceRLは、環境ロールアウト、モデル推論、勾配更新を物理的に分離することで、同期システムに内在するカスケード的な待ち時間を排除し、ハードウェア利用率を最大化する。また、多様なワールドモデルをプラグイン可能なモジュール設計を採用している。実験では、LIBEROの4つのタスクスイートすべてで競争力のある性能を達成し、1,000のオフライン軌道で事前学習したワールドモデルを活用することで、LIBERO-Spatialでオンラインサンプル効率が最大200倍向上した。コードはGitHubで公開されている。
Key Facts
| AcceRLは、環境ロールアウト、モデル推論、勾配更新を物理的に分離する分散非同期RLフレームワークである。 | [1] |
| 同期ベースラインと比較して、スループットが2.4倍向上した。 | [1] |
| 1,000のオフライン軌道で事前学習したワールドモデルを活用し、LIBERO-Spatialでオンラインサンプル効率が最大200倍向上した。 | [1] |
| LIBEROの4つのタスクスイートすべてで競争力のある性能を達成した。 | [1] |
| コードはhttps://github.com/distanceLu/AcceRLで公開されている。 | [1] |
なぜ重要か
VLAモデルの学習効率を大幅に向上させるAcceRLは、ロボットやエージェントの実用化に向けた重要な一歩となる。サンプル効率の向上は、実環境でのデータ収集コストを削減し、より現実的なタスクへの適用を可能にする。今後の実ロボットでの検証や、他のベンチマークでの性能が注目される。