何が起きたか

テキサス大学オースティン校らの研究チームは、大規模な事前学習済みVLAモデルを用いた継続的強化学習の体系的研究を実施し、単純な逐次微調整(Seq. FT)と低ランク適応(LoRA)の組み合わせが、複雑なCRL手法を頻繁に上回ることを発見した。この結果は、2026年3月12日にarXivで公開された論文で報告された。

詳細

研究チームは、多様な生涯強化学習ベンチマークを用いて、大規模な事前学習済みVLAモデルに対するCRLを体系的に調査した。その結果、従来の継続学習の常識に反し、LoRAを用いた単純なSeq. FTが高い可塑性を示し、忘却がほとんどなく、強いゼロショット汎化を維持することが分かった。この堅牢性は、大規模な事前学習モデル、パラメータ効率的適応、オンポリシーRLの相乗効果によるものと分析している。コードはGitHubで公開されている。

Key Facts

テキサス大学オースティン校らの研究チームは、VLAモデルに対する継続的強化学習の体系的研究を実施した。[1]
単純なSeq. FTとLoRAの組み合わせは、複雑なCRL手法を頻繁に上回る性能を示した。[1]
この手法は高い可塑性を示し、忘却がほとんどなく、強いゼロショット汎化を維持した。[1]
堅牢性は、大規模な事前学習モデル、パラメータ効率的適応、オンポリシーRLの相乗効果によるものと分析された。[1]
コードはGitHubで公開されている。[1]

なぜ重要か

この研究は、VLAモデルの継続学習における単純な手法の有効性を実証し、ロボットや自律エージェントの実用化に向けた重要な一歩となる。複雑なCRL手法を避けられることで、計算コストと実装の障壁が下がり、より広範な応用が期待される。