何が起きたか

研究者らは、視覚言語行動(VLA)ポリシーの強化学習後訓練における軌跡レベルクレジット割り当ての問題を解決する新しい手法「Temporal GRPO」を提案した。この手法は、タスク段階を検出し、各ロールアウトを段階固有の行動区間と整列させ、同じ段階に入ったロールアウトのみを比較することで、段階ごとのアドバンテージを対応する区間に適用する。

詳細

従来のGRPOベースのVLA後訓練では、軌跡全体に単一のロールアウトレベルアドバンテージが適用される。そのため、複数の有効な段階を完了したが後で失敗したロールアウトは、初期の進捗を生み出した行動をペナルティする可能性がある。研究者らはこれを「軌跡レベルクレジットエイリアシング」と呼ぶ。 Temporal GRPOは、検出可能なタスク段階を構築し、各ロールアウトを段階固有の行動区間と整列させ、同じ段階に入ったロールアウトのみを比較する。結果として得られる段階アドバンテージは、単一のポリシー更新で対応する区間に適用される。 RoboTwin 2.0では、Temporal GRPOはタスク成功率とサンプル効率を向上させ、タスクの長さに関わらず一貫した改善が見られた。LIBERO-Longでの制御された更新は、共有の前提段階を維持し、ロールアウト結果が分岐する最初の段階に改善を集中させた。

Key Facts

Temporal GRPOは、軌跡レベルクレジットエイリアシング問題に対処するため、検出可能なタスク段階を構築する。[0]
Temporal GRPOは、各ロールアウトを段階固有の行動区間と整列させ、同じ段階に入ったロールアウトのみを比較する。[0]
Temporal GRPOは、段階アドバンテージを対応する区間に単一のポリシー更新で適用する。[0]
RoboTwin 2.0で、Temporal GRPOはタスク成功率とサンプル効率を向上させた。[0]
Temporal GRPOの改善は、タスクの長さに関わらず一貫していた。[0]
LIBERO-Longでの制御された更新は、共有の前提段階を維持し、ロールアウト結果が分岐する最初の段階に改善を集中させた。[0]

なぜ重要か

この研究は、VLAポリシーの強化学習後訓練におけるクレジット割り当ての精度を向上させるものであり、ロボットタスクの成功率とサンプル効率の改善に寄与する可能性がある。