何が起きたか

研究者らは、VLAモデルのファインチューニングを目的とした新しい強化学習フレームワーク「Chunked RL」と、その上で動作するアルゴリズム「CO-RFT」を提案した。CO-RFTは、30〜60サンプルの限られたデモンストレーションを用いてVLAモデルをファインチューニングする手法で、実環境での実験では、従来の教師あり手法と比較して成功率を57%向上させ、サイクルタイムを22.3%短縮した。また、未見の位置に対する位置汎化性能も示し、成功率44.3%を達成した。この研究は、プレプリントサーバーarXivに2025年8月4日付で公開された。

詳細

VLAモデルは、実世界のロボット制御における汎用ポリシーの開発に大きな可能性を示している。この進展により、強化学習(RL)を用いたVLAモデルのファインチューニングへの関心が高まっているが、サンプル効率、アクションチャンキングとの互換性、トレーニングの安定性といった課題が残っている。これらの課題に対処するため、研究者らはアクションチャンキングを組み込んだオフライン強化学習によるVLAモデルのファインチューニングを探求した。 提案されたChunked RLは、VLAモデルに特化した新しい強化学習フレームワークであり、時間差(TD)学習をアクションチャンキングに拡張している。CO-RFTは、このフレームワークに基づくアルゴリズムで、まず全パラメータファインチューニングによる模倣学習(IL)でバックボーンとポリシーを初期化し、その後、アクションチャンキングを用いたオフラインRLで事前学習済みポリシーを最適化する。

Key Facts

CO-RFTは、VLAモデルのファインチューニングのためのアルゴリズムであり、30〜60サンプルの限られたデモンストレーションを使用する。[1]
CO-RFTは、実環境での実験で、従来の教師あり手法と比較して成功率を57%向上させた。[1]
CO-RFTは、サイクルタイムを22.3%短縮した。[1]
CO-RFTは、未見の位置に対する位置汎化性能を示し、成功率44.3%を達成した。[1]
提案されたフレームワークは「Chunked RL」と呼ばれ、VLAモデルに特化した強化学習フレームワークである。[1]
Chunked RLは、時間差(TD)学習をアクションチャンキングに拡張している。[1]
CO-RFTは、まず模倣学習(IL)で全パラメータファインチューニングを行い、バックボーンとポリシーを初期化する。[1]
その後、アクションチャンキングを用いたオフラインRLで事前学習済みポリシーを最適化する。[1]
論文はarXivに2025年8月4日付で公開された。[1]

なぜ重要か

この研究は、VLAモデルのファインチューニングにおけるサンプル効率とアクションチャンキングの互換性という課題に対処するものであり、少数のデモンストレーションで高性能を達成できる可能性を示している。実環境での成功率向上とサイクルタイム短縮は、ロボット制御の実用化に向けた進展として重要である。