何が起きたか
Physical Intelligenceは2026年3月19日、RLトークンを用いたオンライン強化学習手法を発表した。同社によると、RLTはVLAモデルに特殊な出力トークンを追加し、軽量なRLポリシーとのインターフェースを提供することで、モデル全体を微調整せずに数時間で動作を適応させる。4つの精密操作タスクで、最精密な工程を最大3倍高速化し、人間の遠隔操作の速度を超えることができたとしている。
なぜ重要か
ねじ締めやケーブル差し込みのように、位置と向きの微調整が成否を左右する作業で、既存の視覚言語行動モデルを全体再調整せずに短時間で合わせ込める点が要点です。発表元は、四つの精密操作で最も難しい工程を最大三倍速くし、人間の遠隔操作を上回ったとしており、細かな作業の最後の詰めに関わります。