何が起きたか

2026年5月15日、arXivにプレプリント「Learn Where Outcomes Diverge: Efficient VLA RL via Probabilistic Chunk Masking」が公開された。研究チームは、VLAポリシーのRL後訓練において、勾配計算が壁時計時間の約78%を占めることを発見し、これを削減する手法PCMを提案した。PCMは、成功と失敗のロールアウトが分岐するフェーズにのみ勾配計算を集中させることで、計算効率を向上させる。

詳細

PCMは、GRPOベースのVLA RLにおいて、各軌道のチャンクのうち20%未満にのみ逆伝播を行う。手法は、成功-失敗アクション分散を指標として各フェーズの勾配分散を推定し、オンライン更新されるフェーズ別の保持確率に基づいてチャンクをサンプリングする。これにより、報酬モデルや学習済み批評家を必要としない。実験では、3つのLIBEROベンチマークで標準GRPOと同等の最終成功率を達成しつつ、壁時計時間で2.38倍、勾配更新で4.8倍の高速化、ピーク活性化メモリを60%削減した。

Key Facts

GRPOベースのVLA RLでは、勾配計算が1ステップあたりの壁時計時間の約78%を占め、ロールアウト収集は約21%である。[1]
PCMは、GRPOのドロップイン変更であり、軌道ごとに確率的に選択された少数のチャンクに勾配計算を割り当てる。[1]
PCMは、成功-失敗アクション分散を指標としてフェーズの勾配分散を推定し、オンライン更新されるフェーズ別保持確率でチャンクをサンプリングする。[1]
PCMは、3つのLIBEROベンチマークで標準GRPOと同等の最終成功率を達成し、壁時計時間で2.38倍、勾配更新で4.8倍の高速化、ピーク活性化メモリを60%削減した。[1]
PCMは、逆伝播を軌道チャンクの20%未満にのみ行う。[1]

なぜ重要か

VLAモデルのRL後訓練は計算コストが高く、実用化の障壁となっている。PCMは、勾配計算を効率化することで、同等の性能を維持しつつ学習時間を大幅に短縮できる可能性を示しており、ロボット学習の研究開発を加速させる可能性がある。