何が起きたか

Physical Intelligenceは、ロボット学習の新しい手法「Recap」(RL with Experience & Corrections via Advantage-conditioned Policies)を発表した。同社は、この手法を用いて最新の視覚言語行動(VLA)モデルπ0.6を改良し、π*0.6を開発したとしている。Recapは、人間によるデモンストレーション、コーチングとしての修正、自律的な経験からの学習の3つのステップを実装するという。同社によると、π*0.6は自律経験による訓練で、最も難しいタスクのスループットを2倍以上にし、失敗率を2倍以上低減できるとしている。また、π*0.6は、エスプレッソドリンクを5:30から23:30まで作り続け、新しい家庭で50種類の新しい洗濯物を折りたたみ、実際の工場でチョコレートの包装に使われる箱を59個組み立ててラベルを貼ることを、数時間中断なしで実証したとしている。

Key Facts

Physical Intelligenceは、ロボット学習の新しい手法「Recap」(RL with Experience & Corrections via Advantage-conditioned Policies)を発表した。[0]
Recapは、デモンストレーション、修正、自律経験の3つのステップを実装する。[0]
同社は、Recapを用いてVLAモデルπ0.6を改良し、π*0.6を開発したとしている。[0]
同社によると、π*0.6は自律経験による訓練で、最も難しいタスクのスループットを2倍以上にし、失敗率を2倍以上低減できるとしている。[0]
同社は、π*0.6がエスプレッソドリンクを5:30から23:30まで作り続け、新しい家庭で50種類の新しい洗濯物を折りたたみ、実際の工場でチョコレートの包装に使われる箱を59個組み立ててラベルを貼ることを、数時間中断なしで実証したとしている。[0]

なぜ重要か

ロボット学習において、デモンストレーションのみを用いた教師あり学習では成功率が半分程度に留まることが多く、複雑な実世界タスクで人間レベルのスループットを達成することは困難とされる。Recapは、修正と自律経験を組み合わせることで、ロボットの信頼性と効率を実用的なレベルに引き上げる可能性を示しており、実世界でのロボット応用に向けた進展として注目される。