何が起きたか
arXivに2026年8月18日付で公開された論文「Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups」は、視覚・言語・行動(VLA)ポリシーの強化学習手法Prism-GRPOを提案している。同手法は、バイナリの成功報酬に重み付き軌道レベルの実行品質スコアを追加し、同一結果のグループを品質スペクトルに分割することで、ゼロアドバンテージにより破棄されるグループを減らし、ロールアウト数を最大56%削減するとしている。
詳細
GRPOは、PPOと異なり批評家の訓練を必要としないため、VLAポリシーの強化学習で広く使われているが、グループ相対アドバンテージを得るために各シーンから複数のロールアウトを必要とする。バイナリ成功報酬の下では、すべて成功またはすべて失敗のグループはアドバンテージがゼロとなり、動的サンプリングで破棄される。これらのグループは訓練初期に特に多く、ロボットのロールアウト予算を浪費する。 Prism-GRPOは、シミュレータの接触、実行アクション、視覚観察から導出できる品質スコアを用いて、同一結果グループを品質スペクトルに分割し、訓練信号を回復する。論文では、Prism-GRPOがサンプリングされたグループがゼロアドバンテージで破棄される確率を増加させないこと、およびタスク成功の局所的上昇方向を維持する勾配整合条件を証明している。 4つのRoboTwinタスク(異なるホライズンと協調パターンを含む)で、Prism-GRPOは一致したロールアウト予算で成功率と品質を向上させ、目標成功率に達するまでのロールアウト数を最大56%削減した。また、報酬ハッキングの近道を抑制し、実ロボットへの直接展開でよりクリーンな挙動が転移することも示された。アブレーションでは、接触、滑らかさ、VLM由来の品質信号で一貫した改善が見られた。
Key Facts
| Prism-GRPOは、バイナリ成功報酬に重み付き軌道レベルの実行品質スコアを追加する手法である。 | 出典一覧 |
| Prism-GRPOは、同一結果グループを品質スペクトルに分割し、訓練信号を回復する。 | 出典一覧 |
| 品質スコアは、シミュレータの接触、実行アクション、視覚観察から導出できる。 | 出典一覧 |
| Prism-GRPOは、サンプリングされたグループがゼロアドバンテージで破棄される確率を増加させないことを証明している。 | 出典一覧 |
| 4つのRoboTwinタスクで、Prism-GRPOは目標成功率に達するまでのロールアウト数を最大56%削減した。 | 出典一覧 |
| Prism-GRPOは報酬ハッキングの近道を抑制し、実ロボットへの直接展開でよりクリーンな挙動が転移する。 | 出典一覧 |
| アブレーションでは、接触、滑らかさ、VLM由来の品質信号で一貫した改善が見られた。 | 出典一覧 |
なぜ重要か
Prism-GRPOは、ロボットのロールアウト予算を節約しながらVLAポリシーの学習効率を向上させる手法であり、実ロボット展開での性能向上も示している。強化学習のサンプリング効率改善は、ロボット学習の実用化に寄与する可能性がある。