何が起きたか
研究者らは、VLAモデルの連続的なポストトレーニングを可能にするフレームワーク「CRL-VLA」を提案した。arXivに2026年2月3日付で公開された論文で発表された。LIBEROベンチマークでの実験により、忘却防止と前方適応の両方で既存手法を上回る結果を示したとしている。
詳細
CRL-VLAは、安定性(旧スキルの保持)と可塑性(新スキルの学習)のトレードオフを、目標条件付きアドバンテージの大きさと方策の乖離に基づく統一的な性能バウンドとして定式化する。このジレンマを、旧タスクではアドバンテージの大きさを制約し、新タスクでは制御された成長を可能にする非対称な調整によって解決する。具体的には、凍結されたクリティックが意味的一貫性を固定し、学習可能な推定器が適応を駆動する「Goal-Conditioned Value Formulation (GCVF)」を備えたデュアルクリティックアーキテクチャを採用する。
Key Facts
| CRL-VLAは、VLAモデルの連続的なポストトレーニングのためのフレームワークであり、厳密な理論的バウンドを持つ。 | [1] |
| CRL-VLAは、安定性と可塑性のトレードオフを、目標条件付きアドバンテージの大きさと方策の乖離に基づく統一的な性能バウンドとして定式化する。 | [1] |
| CRL-VLAは、凍結されたクリティックと学習可能な推定器を備えたデュアルクリティックアーキテクチャ(GCVF)を採用する。 | [1] |
| LIBEROベンチマークでの実験により、CRL-VLAは忘却防止と前方適応の両方でベースラインを上回る性能を示した。 | [1] |
なぜ重要か
この研究は、VLAモデルが実世界で継続的に学習するための理論的基盤を提供するものであり、ロボットの適応能力向上に寄与する可能性がある。今後の実ロボット応用や、より大規模なタスクへの展開が焦点となる。