何が起きたか
研究チームは、VLAモデルの下流操作タスクへの適応を目的とした新しいRL後訓練フレームワーク「TEMPO」を提案した。従来のSFTは分布ミスマッチを起こしやすく、既存のRL手法は全コンポーネントに一様な更新戦略を適用していた。TEMPOは、事前学習済みの視覚言語バックボーンを凍結し、意味射影層と低レベル行動エキスパートの2コンポーネントのみを専用のRLループで適応させる。意味射影層は低頻度で更新して潜在行動を安定させ、行動エキスパートは高頻度で更新してオンラインの制御フィードバックを迅速に取り込む。この分離により、高速なポリシー更新が高次意味表現を不安定化するのを防ぎつつ、行動エキスパートは効率的に学習できる。CALVINベンチマークと実世界の操作タスクで、既存の最先端VLAモデルやRL後訓練ベースラインを一貫して上回る性能を示した。
Key Facts
| TEMPOは、VLAモデルのRL後訓練において、事前学習済みの視覚言語バックボーンを凍結し、意味射影層と低レベル行動エキスパートのみを適応させる。 | [0] |
| 意味射影層は低頻度で更新され、行動エキスパートは高頻度で更新される。 | [0] |
| CALVINベンチマークと実世界の操作タスクで、既存の最先端VLAモデルとRL後訓練ベースラインを上回る性能を達成した。 | [0] |
なぜ重要か
VLAモデルはロボット操作などの物理AI応用で重要だが、従来の後訓練手法は意味表現と行動学習のバランスが課題だった。TEMPOは両者を分離し異なる時間スケールで更新することで、意味表現の安定性を保ちながら行動学習の効率を高める。これにより、実世界の操作タスクでの性能向上が期待され、ロボット学習の効率化に寄与する可能性がある。