何が起きたか

Physical Intelligenceは、同社の研究ブログで、精密な操作タスクを改善するための新しい強化学習手法「RL tokens (RLT)」を発表した。同社のモデルは、洗濯物をたたむ、コーヒーを淹れる、グリルドチーズサンドイッチを調理するなど、多様な指示に従い幅広いタスクを実行できるが、多くのアプリケーションでは精度、器用さ、速度が求められる。RLはデモンストレーションだけでは学ぶのが難しい行動を改善する自然な方法であり、同社の以前の手法「Recap」は長期的なタスクの広範な改善に焦点を当てていた。RLTは、微細な操作を必要とする精密で繊細なタスクの改善に特化しており、数分から数時間の実世界の経験から学習する。RLTは、VLAと軽量なRLポリシーの間のコンパクトなインターフェースを提供する特別な出力トークンを追加し、モデル全体を微調整することなく、ロボットが数時間で動作を適応できるようにする。4つの挑戦的な操作タスクにおいて、RLTは各タスクの最も精密な段階を最大3倍高速化し、人間のテレオペレーションの速度を超えることができたとしている。

Key Facts

Physical Intelligenceは、精密な操作タスクを改善するための新しい強化学習手法「RL tokens (RLT)」を発表した。[0]
同社のモデルは、洗濯物をたたむ、コーヒーを淹れる、グリルドチーズサンドイッチを調理するなど、多様な指示に従い幅広いタスクを実行できる。[0]
RLTは、VLAと軽量なRLポリシーの間のコンパクトなインターフェースを提供する特別な出力トークンを追加し、モデル全体を微調整することなく、ロボットが数時間で動作を適応できるようにする。[0]
4つの挑戦的な操作タスクにおいて、RLTは各タスクの最も精密な段階を最大3倍高速化し、人間のテレオペレーションの速度を超えることができたとしている。[0]
同社の以前の手法「Recap」は、長期的なタスクの広範な改善に焦点を当てていた。[0]

なぜ重要か

この発表は、ロボットが実世界の経験から短時間で精密な操作スキルを学習できる可能性を示すものであり、産業用組立や家事など、高い精度が求められるタスクへの応用が期待される。