何が起きたか

2026年4月24日にarXivに公開された論文(ID: 2604.23073v2)で、VLAモデルのオンラインRL微調整を効率化する手法「RL Token」が提案された。この手法は、事前学習済みVLAに「RLトークン」を導入し、小型のアクタークリティックヘッドを訓練することで、数時間の実機練習で成功率を大幅に向上させる。4つの実ロボットタスク(ネジ締め、結束バンド締め、充電器挿入、イーサネット挿入)で、最難関部分の速度を最大3倍に改善したと報告している。

詳細

論文は、VLAモデルが多様な操作スキルを「そのまま」学習できる一方、実世界のタスクで要求される精度と速度を達成するには追加の微調整(例:強化学習)が必要だと指摘する。提案手法は、(1) VLAを適応させて「RLトークン」を露出させる。これは、タスク関連の事前学習知識を保持しつつ、オンラインRLの効率的なインターフェースとして機能するコンパクトな読み出し表現である。(2) このRLトークン上で小型のアクタークリティックヘッドを訓練し、アクションを洗練させつつ、学習ポリシーをVLAに固定する。オンラインRL with RLトークン(RLT)により、大きなVLAでもRLで迅速かつ効率的に微調整が可能になる。4つの実ロボットタスク(ネジ締め、結束バンド締め、充電器挿入、イーサネット挿入)で、RLTはタスクの最難関部分の速度を最大3倍向上させ、成功率を数分から数時間の練習で大幅に向上させた。一部のタスクでは、人間のテレオペレーションの速度を上回ることもできたとしている。

Key Facts

論文は2026年4月24日にarXivで公開された(ID: 2604.23073v2)。[1]
提案手法はVLAに「RLトークン」を導入し、小型のアクタークリティックヘッドを訓練する。[1]
4つの実ロボットタスク(ネジ締め、結束バンド締め、充電器挿入、イーサネット挿入)で、最難関部分の速度を最大3倍向上させた。[1]
成功率は数分から数時間の練習で大幅に向上したと報告されている。[1]
一部のタスクでは、人間のテレオペレーションの速度を上回ったとしている。[1]

なぜ重要か

この手法は、VLAモデルの実世界応用における大きな障壁であるオンラインRLの非効率性を解決する可能性を秘めている。数時間の練習で人間のテレオペレーションを上回る速度を達成できることは、ロボットの自律化を加速させる。読者にとっては、ロボットの導入コスト削減や、より複雑なタスクへの自動化拡大につながる重要な進展と言える。