何が起きたか

Physical Intelligenceは、ロボット学習の新しい手法「Recap(RL with Experience & Corrections via Advantage-conditioned Policies)」を開発し、これを適用したVLAモデル「π*0.6」を発表した。Recapは、人間によるデモンストレーション、コーチングによる修正、自律的な経験の3段階でロボットを訓練する。同社は、π*0.6がエスプレッソ飲料の作成、箱の組み立て、多様な洗濯物の折りたたみなどの複雑なタスクを堅牢かつ効率的に実行できるとしている。

Key Facts

Physical Intelligenceは、ロボット学習手法「Recap」を開発し、VLAモデル「π0.6」を改良した「π*0.6」を発表した。[0]
Recapは、デモンストレーション、修正、自律経験の3段階でロボットを訓練する手法である。[0]
π*0.6は、エスプレッソ飲料の作成、箱の組み立て、多様な洗濯物の折りたたみなどの複雑なタスクを実行できる。[0]
同社は、自律経験による訓練でスループットが2倍以上になり、失敗率が2倍以上減少したとしている。[0]
π*0.6は、午前5時30分から午後11時30分までエスプレッソ飲料を作成し、新しい家庭で50種類の新しい洗濯物を折りたたみ、実際の工場でチョコレートの包装に使われる59個の箱を組み立ててラベルを貼った。[0]

なぜ重要か

この発表は、ロボット学習における模倣学習の限界を克服し、自律経験による改善を可能にする手法を示した点で重要である。Physical Intelligenceは、Recapによりロボットが実用的なレベルの堅牢性に達し、長時間の連続作業が可能になったと主張している。これは、実世界のロボットタスクにおける信頼性と効率性の向上に寄与する可能性がある。