何が起きたか

Physical Intelligenceは、ロボットが複雑なタスクを遂行する際に、人間の思考プロセスを模倣するシステム「Hi Robot」を開発したと発表した。このシステムは、視覚・言語・行動(VLA)モデルであるπ0を「システム1」として、高次の意味的視覚言語モデル(VLM)を「システム2」として組み込む。システム2は、複雑なタスクを中間ステップに分解し、π0に個々のステップを指示する。また、ユーザーからのリアルタイムな文脈フィードバック(例:「それはゴミじゃない」)を理解し、指示を適切に解釈してπ0に伝えることも可能だとしている。

Key Facts

Physical Intelligenceは、ロボット向けの2段階推論システム「Hi Robot」を開発したと発表した。[0]
Hi Robotは、VLAモデルπ0を「システム1」として、高次の意味的VLMを「システム2」として組み込む。[0]
システム2は、複雑なタスクを中間ステップに分解し、π0に個々のステップを指示する。[0]
システム2は、ユーザーのリアルタイムな文脈フィードバック(例:「それはゴミじゃない」)を理解し、指示を適切に解釈してπ0に伝える。[0]

なぜ重要か

このシステムは、ロボットが複雑なタスクを自律的に処理する能力を向上させる可能性がある。特に、ユーザーとのリアルタイムな対話を通じてタスクを調整できる点は、実用的な応用につながる可能性がある。