何が起きたか
2025年5月22日にarXivに公開された論文(識別番号2505.17016v1)で、研究者らはRIPT-VLA(Reinforcement-Learning-based Interactive Post-Training for Vision-Language-Action Models)を発表した。RIPT-VLAは、スパースな二値成功報酬のみを用いて事前学習済みのVLAモデルを微調整する、シンプルでスケーラブルな強化学習ベースの対話型ポストトレーニング手法である。論文によると、軽量モデルQueSTでは21.2%の改善、7BモデルOpenVLA-OFTでは97.5%の成功率を達成した。
詳細
既存のVLAトレーニングパイプラインは、オフラインの専門家デモデータと教師あり模倣に大きく依存しており、低データ環境での新しいタスクや環境への適応が制限される。RIPT-VLAは、動的ロールアウトサンプリングとリーブワンアウトアドバンテージ推定に基づく安定したポリシー最適化アルゴリズムを用いて、対話型ポストトレーニングを可能にする。 データ効率の面では、わずか1つのデモンストレーションで、動作しなかったSFTモデル(成功率4%)を15イテレーション以内に97%の成功率へと向上させた。さらに、RIPT-VLAで学習されたポリシーは、異なるタスクやシナリオに一般化し、初期状態の文脈に対してロバストであるとしている。
Key Facts
| RIPT-VLAは、スパースな二値成功報酬のみを用いて事前学習済みVLAモデルを微調整する強化学習ベースの対話型ポストトレーニング手法である。 | [1] |
| RIPT-VLAは軽量モデルQueSTで21.2%の改善を達成した。 | [1] |
| RIPT-VLAは7BモデルOpenVLA-OFTで97.5%の成功率を達成した。 | [1] |
| わずか1つのデモンストレーションで、動作しなかったSFTモデル(成功率4%)を15イテレーション以内に97%の成功率へと向上させた。 | [1] |
| RIPT-VLAは動的ロールアウトサンプリングとリーブワンアウトアドバンテージ推定に基づく安定したポリシー最適化アルゴリズムを用いる。 | [1] |
| 既存のVLAトレーニングパイプラインはオフラインの専門家デモデータと教師あり模倣に依存しており、低データ環境での適応が制限される。 | [1] |
| RIPT-VLAで学習されたポリシーは異なるタスクやシナリオに一般化し、初期状態の文脈に対してロバストである。 | [1] |
なぜ重要か
RIPT-VLAは、最小限の教師信号でVLAモデルをポストトレーニングする実用的で効果的なパラダイムを提供する。これにより、低データ環境での新しいタスクや環境への適応が可能になり、ロボット学習の効率と汎用性が向上する可能性がある。