何が起きたか
2026年8月16日にarXivで公開された論文「Robo-Dopamine 2.0: History-Conditioned and OOD-Aware Process Reward Modeling for Robotic Manipulation」において、Robo-Dopamine 2.0が発表された。このモデルは、履歴条件付きペアワイズ報酬とOOD認識符号付き進行空間を組み合わせ、ロボット操作の強化学習を改善する。実験では、平均視覚順序一貫性(VOC)を0.967から0.986に、OODロバストVOCを0.906から0.958に向上させた。下流の強化学習では、平均RoboTwin成功率86.8%、実世界挿入71/80回成功を達成した。
詳細
VLAモデルはロボット操作を改善するが、複合エラー、シーン変化、軌道外状態に対して脆弱である。強化学習は事前学習済みVLAポリシーを洗練できるが、疎な成功信号は探索を妨げ、工学的な密報酬はコストが高くタスク固有である。既存の学習型視覚報酬モデルは、静的な前後観察に依存することが多く、時間的曖昧さと、OOD実行下でのロバスト性維持変動とタスク無効失敗の識別力の弱さを引き起こす。 Robo-Dopamine 2.0は、ペアワイズ予測インターフェースを備えた履歴・OOD認識プロセス報酬モデルである。合成OODクエリにはソース整合参照パネルを、オンラインクエリには観測ロールアウト履歴を使用し、クエリのエンドポイントを保持する。OOD認識符号付き進行空間は、有効な進行、ロバスト性、失敗、回復を表現する。遷移認識リプレイを備えたSigned-Hopカリキュラムは、粗い実行順序を学習してから細かい進行キャリブレーションを行う。また、OOD軌道データセットと5ファミリーベンチマークも構築された。 同じ40万ペアワイズ報酬予算で、25%リプレイのSigned-Hopトレーニングは平均VOC 0.9872を達成し、マッチドプールシャッフル対照群の0.9858を上回った。
Key Facts
| Robo-Dopamine 2.0は、履歴条件付きペアワイズ報酬とOOD認識符号付き進行空間を組み合わせたプロセス報酬モデルである。 | [1] |
| 平均視覚順序一貫性(VOC)は0.967から0.986に向上した。 | [1] |
| OODロバストVOCは0.906から0.958に向上した。 | [1] |
| 下流の強化学習で平均RoboTwin成功率86.8%を達成した。 | [1] |
| 実世界挿入で71/80回成功した。 | [1] |
| Signed-Hopトレーニングは25%リプレイで平均VOC 0.9872を達成し、対照群の0.9858を上回った。 | [1] |
| OOD軌道データセットと5ファミリーベンチマークが構築された。 | [1] |
なぜ重要か
この研究は、ロボット操作におけるVLAモデルの強化学習を改善する新しい手法を提案する。履歴とOOD認識を組み込むことで、従来の静的報酬モデルの限界を克服し、実世界での成功率を向上させる可能性がある。