何が起きたか
Physical Intelligenceは、ロボット基盤モデル「π0.5」を発表した。同モデルは、同社のVLAモデル「π0」を基に、異種データの共学習により、訓練データにない新しい環境への汎化を実現したとしている。同社は、これを「真に汎用的な物理知能」への重要な一歩としている。
詳細
Physical Intelligenceは、ロボットの最大の課題は「汎化」にあると指摘する。家庭内の清掃ロボットを例に、低レベルでは見たことのないスプーンや皿の持ち方を理解し、高レベルではタスクの意味論(衣類や靴の置き場所、こぼれを拭く道具の選択など)を理解する必要があると説明する。しかし、多様なデータの不足が汎化を難しくしており、現在の商業ロボットは工場や倉庫など管理された環境でしか成功していないと述べる。 π0.5は、異種データの共学習を原理とし、画像キャプション、視覚的質問応答、物体検出などの一般的なマルチモーダルタスクと、ロボットの行動デモンストレーション、高レベルのロボット例(未整頓のベッドに「枕を拾う」というラベルを付けた観察など)、人間が自然言語で段階的に指示する「口頭指示」デモンストレーションを組み合わせて訓練される。これにより、モデルはチェーン・オブ・ソートに類似した高レベルの推論と、ロボットの関節へのモーター指令を出力する低レベルの予測の両方を行う。 実験では、π0.5は訓練データにない新しい家庭で、皿をシンクに置くなどの物体の再配置から、スポンジでこぼれを拭き取るなどの複雑な行動まで、多様なタスクを実行できた。ただし、常に最初の試行で成功するわけではなく、人間が新しい課題に取り組む際の柔軟性と機知の片鱗を示すことが多いとしている。同社は、現在のモデルは完璧ではなく、新しいスキルの習得や高度な器用さではなく、新しい環境への汎化を目的としていると明言する。
Key Facts
| Physical Intelligenceは、VLAモデル「π0.5」を発表した。 | [0] |
| π0.5は、同社のVLAモデル「π0」を基に開発された。 | [0] |
| π0.5は、訓練データにない新しい家庭環境で、皿洗いやベッドメイキングなどのタスクを実行できる。 | [0] |
| π0.5の主な原理は、異種データの共学習である。 | [0] |
| 共学習には、画像キャプション、視覚的質問応答、物体検出などの一般的なマルチモーダルタスクが含まれる。 | [0] |
| 共学習には、ロボットの行動デモンストレーションや、観察に適切な意味行動をラベル付けした高レベルのロボット例が含まれる。 | [0] |
| 共学習には、人間が自然言語で段階的に指示する「口頭指示」デモンストレーションが含まれる。 | [0] |
| π0.5は、新しい家庭で皿をシンクに置くなどの物体の再配置から、スポンジでこぼれを拭き取るなどの複雑な行動まで実行できる。 | [0] |
| 同社は、π0.5は常に最初の試行で成功するわけではないが、人間の柔軟性と機知の片鱗を示すとしている。 | [0] |
| 同社は、現在のモデルは新しいスキルの習得や高度な器用さではなく、新しい環境への汎化を目的としていると述べている。 | [0] |
なぜ重要か
ロボットの実用化には、管理された環境を超えた「汎化」が不可欠とされる中、π0.5は新しい環境への汎化を示した点で意義がある。同社は、これを「真に汎用的な物理知能」への重要な一歩と位置づけており、家庭やオフィスなど「雑然とした環境」でのロボット活用の可能性を示唆する。