何が起きたか
2026年7月10日にarXivに公開された論文「Learning More from Less: Reinforcement Learning from Hindsight」において、VLAモデルのRL後訓練のサンプル効率を改善する手法LfHが発表された。LfHは、失敗したロールアウトを実際に達成したタスクに再ラベル付けすることで、スパースな報酬環境下でも学習を促進する。実験では、分布外のLIBERO-PROタスクで標準RLと比較してサンプル効率が5倍向上し、密な進捗報酬ベースラインを上回ったとされる。
詳細
LfHは、単一の視覚言語モデル(VLM)が失敗したロールアウト群に対してヒンドサイト指示を提案し、各ロールアウトがその指示をどの程度満たしているかをスコアリングする。ポリシーは再ラベル付けされたロールアウトと元のロールアウトを併用して訓練される。VLAの言語汎化能力により、言語での再ラベル付けが同一軌道からの学習を強化する。実験は複数のVLAバックボーンと物理的なFrankaロボットで行われ、効果が確認された。
Key Facts
| LfHは失敗したロールアウトを実際に達成したタスクに再ラベル付けする手法であり、単一のVLMが指示と報酬の両方を再ラベル付けする。 | [1] |
| 分布外のLIBERO-PROタスクにおいて、標準RLと比較してサンプル効率が5倍向上した。 | [1] |
| LfHは密な進捗報酬ベースラインを上回った。 | [1] |
| 効果は複数のVLAバックボーンと物理的なFrankaロボットで確認された。 | [1] |
なぜ重要か
VLAモデルの実用化には、ロボットの実機での試行錯誤が不可欠だが、そのコストは高い。LfHは失敗データを有効活用することで、学習に必要なロールアウト数を削減できる可能性を示しており、ロボット学習の効率化に寄与する。これは、物理ロボットでの展開を目指す研究開発において、コストと時間の大幅な削減につながる重要な進展である。