何が起きたか

Physical Intelligenceは、同社の研究ブログで、ロボット基盤モデルにおける人間からロボットへの転移の創発について発表した。同社によると、大規模なロボット基盤モデルは、多様なデータソースを活用する能力が創発的に現れるという。具体的には、ウェアラブルカメラで記録された自己中心的な人間の動画データを、ロボットの訓練に利用する手法を開発し、ロボットデータが限られたタスクで約2倍の改善を達成したとしている。

Key Facts

Physical Intelligenceは、ロボット基盤モデルをスケールアップすることで、人間の動画からロボットタスクへの転移が創発的に現れると発表した。[0]
同社は、自己中心的な人間の動画データを活用する手法を開発し、ロボットデータが限られたタスクで約2倍の改善を提供したとしている。[0]
同社は、人間とロボットの見た目や動きの違いによるドメインギャップが課題であると説明している。[0]
同社は、人間の動画データをロボットの訓練に使う従来の方法として、画像のマスキングや生成モデルによる手の変換、ヒューマノイドロボットの使用などを挙げている。[0]
同社は、明示的な転移学習メカニズムなしに、ロボット基盤モデルのスケールアップだけで転移が可能かどうかを検証したとしている。[0]

なぜ重要か

この発表は、ロボット基盤モデルのスケールアップによって、人間の動画データを直接ロボットの訓練に活用できる可能性を示すものである。従来はドメインギャップを埋めるための特別な処理が必要とされていたが、モデルの大規模化によってその必要性が軽減される可能性がある。