日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
強化学習/VLAarXiv:2608.13026v1

時間的GRPO:視覚言語行動強化学習における軌跡レベルの信用割当を超えて

Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning

シェア:XThreadsFacebookLINEはてブBluesky

軌跡全体に同じ報酬を割り当てる従来のGRPOの問題を解決するため、タスクを段階に分割し、同じ段階に到達した軌跡同士を比較して段階ごとの利点を計算する新しい手法を提案した。

詳しい要約

1. どんなもの?

Temporal GRPOは、Vision-Language-Action (VLA)ポリシーの強化学習後訓練におけるクレジット割り当て問題を解決する手法。従来のGRPOベースの手法では、軌跡全体に単一の報酬(rollout-level advantage)を適用するため、途中まで成功しても最終的に失敗した軌跡の初期の有効な行動が不当にペナルティを受ける。これをtrajectory-level credit aliasingと呼ぶ。Temporal GRPOは、検出可能なタスク段階を構築し、各軌跡を段階固有の行動区間に対応付け、同じ段階に入った軌跡同士のみを比較することで、段階ごとのadvantageを計算し、対応する区間に適用する。

2. 先行研究と比べてどこがすごい?

従来のGRPOベースのVLA後訓練では、軌跡全体に単一のadvantageを適用するため、部分的な進捗が評価されず、クレジット割り当てが不正確だった。Temporal GRPOは、段階ごとのクレジット割り当てを導入することで、この問題を解決し、タスク成功とサンプル効率を向上させる。

3. 技術・手法の肝は?

手法の核は、タスクを検出可能な段階に分割し、各軌跡を段階固有の行動区間に対応付けること。そして、同じ段階に入った軌跡のみを比較して段階ごとのadvantageを計算し、それを対応する行動区間に適用する。これにより、軌跡全体の結果に依存せず、段階ごとの進捗を正確に評価できる。

4. どうやって有効だと検証した?

RoboTwin 2.0ベンチマークで評価し、タスク成功率とサンプル効率の向上を確認。また、LIBERO-Longでの制御された更新実験により、共有の前提段階を維持しつつ、軌跡の結果が分岐する最初の段階に改善が集中することを示した。

5. 議論はある?

要旨からは、Temporal GRPOの限界や潜在的な欠点についての議論は不明。ただし、段階の検出可能性や、段階分割の自動化などが課題となる可能性が考えられるが、要旨には明記されていない。

6. 次に読むべき論文は?

要旨で参照されているGRPO(Group Relative Policy Optimization)や、VLAポリシーの後訓練に関する関連研究。具体的には、RoboTwinやLIBEROなどのベンチマークを用いた研究が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Yao Zhou, Hang Gao, Fengge Wu, Changwen Zheng, Wenwen Qiang

分類: cs.RO

原文アブストラクト

Outcome-driven reinforcement learning offers a scalable way to post-train vision-language-action (VLA) policies from sparse task-success feedback. In common GRPO-based VLA post-training, one rollout-level advantage is applied to every action in the trajectory. A rollout that completes several valid stages but fails later can therefore penalize the actions that produced its earlier progress. We call this trajectory-level credit aliasing. Temporal GRPO addresses this problem by constructing detectable task stages, aligning each rollout with stage-specific action intervals, and comparing only rollouts that have entered the same stage. The resulting stage advantages are applied to their corresponding intervals in a single policy update. On RoboTwin 2.0, Temporal GRPO improves task success and sample efficiency, with consistent gains across task horizons. Controlled updates on LIBERO-Long preserve shared prerequisite stages and concentrate improvement at the first stage where rollout outcomes diverge.