何が起きたか
中国科学院の研究チームは、VLAモデル向けの分散非同期強化学習フレームワーク「AcceRL」を発表した。arXivに掲載された論文(2026年3月19日付)によると、同期型ベースラインと比較してスループットが2.4倍、LIBERO-Spatialタスクではサンプル効率が最大200倍向上したとしている。
詳細
AcceRLは、環境ロールアウト、モデル推論、勾配更新を物理的に分離することで、同期システムに内在するカスケード的な待ち時間を排除し、ハードウェア利用率を最大化する。また、多様なワールドモデルをプラグイン可能なモジュール設計を採用している。実験では、LIBEROの4つのタスクスイートすべてで競争力のある性能を達成し、1,000のオフライン軌道で事前学習したワールドモデルを活用することで、LIBERO-Spatialでオンラインサンプル効率が最大200倍向上した。コードはGitHubで公開されている。
Key Facts
| AcceRLは、環境ロールアウト、モデル推論、勾配更新を物理的に分離する分散非同期RLフレームワークである。 | 出典一覧 |
| 同期ベースラインと比較して、スループットが2.4倍向上した。 | 出典一覧 |
| 1,000のオフライン軌道で事前学習したワールドモデルを活用し、LIBERO-Spatialでオンラインサンプル効率が最大200倍向上した。 | 出典一覧 |
| LIBEROの4つのタスクスイートすべてで競争力のある性能を達成した。 | 出典一覧 |
| コードはhttps://github.com/distanceLu/AcceRLで公開されている。 | 出典一覧 |
本紙の見方
今回の発表は、VLAモデルの強化学習におけるスケーラビリティ問題への一つの解答を示すものだ。同期型RLでは、環境ロールアウト、推論、勾配更新の各段階が直列に実行されるため、ボトルネックが発生しやすい。AcceRLはこれらを物理的に分離し、非同期で動作させることで、ハードウェア利用率を高め、スループットを2.4倍に向上させた。これは、大規模VLAモデルの学習時間を短縮する上で重要な進展とみられる。 特に注目すべきは、ワールドモデルを活用したサンプル効率の向上だ。1,000のオフライン軌道で事前学習したワールドモデルを組み込むことで、オンラインサンプル効率が最大200倍向上した。これは、実環境でのデータ収集コストが高いロボット学習において、シミュレーションやオフラインデータを活用する戦略の有効性を示唆している。 一方で、今回の結果はLIBEROベンチマークに限定されており、実ロボットでの検証や、より複雑なタスクでの性能は未確認だ。また、ワールドモデルの事前学習に必要なオフライン軌道の質や量が性能に与える影響も、今後の論点になるだろう。 業界構造への含意としては、VLAモデルの学習効率を高めるフレームワークの登場が、ロボット学習の実用化を加速させる可能性がある。特に、データ収集コストの削減は、実世界での展開を目指す企業にとって大きな意味を持つ。ただし、AcceRLが標準的なフレームワークとなるかは、今後のコミュニティでの採用状況や、他の手法との比較検証を待つ必要がある。
なぜ重要か
VLAモデルの学習効率を大幅に向上させるAcceRLは、ロボットやエージェントの実用化に向けた重要な一歩となる。サンプル効率の向上は、実環境でのデータ収集コストを削減し、より現実的なタスクへの適用を可能にする。今後の実ロボットでの検証や、他のベンチマークでの性能が注目される。