何が起きたか

Physical Intelligenceは2025年2月26日、ロボット制御のための新しいシステム「Hi Robot(Hierarchical Interactive Robot)」を発表した。このシステムは、視覚・言語・行動(VLA)モデルであるπ0を低レベルの「システム1」として、高次のセマンティックな視覚言語モデル(VLM)を「システム2」として用いる2段階の推論プロセスを採用する。システム2は複雑なタスクを中間ステップに分解し、π0に指示を「ささやく」ことで、ロボットが複雑な指示やユーザーのリアルタイムなフィードバックを処理できるようにする。

詳細

Hi Robotの高レベルポリシーは、π0と同じVLMバックボーンを使用しており、複雑なプロンプトを処理し、シーンを観察してタスクを小さなステップに分解するよう訓練されている。例えば、テーブルを片付ける際にユーザーが「それはゴミじゃない」と言った場合、モデルはその意味を理解し、ロボットが操作している物体を画像内で特定し、「それはゴミ箱に入れるべきではない」という暗黙の指示を解釈して、π0に正しい中間ステップを伝える。 この階層的推論が有利な理由として、Physical Intelligenceは、言語モデルが複雑な問題解決に優れるのと同様に、Hi Robotも複雑なプロンプトをπ0が理解できる単純なステップに分解することで、より良い処理が可能になると説明している。また、VLMのウェブスケール事前学習により、モデルは画像とテキストの文脈を参照する質問に答える能力をすでに備えており、Hi Robotはその知識を継承できるとしている。 トレーニングデータに関しては、単純なコマンドで注釈されたデモンストレーションだけでは不十分であるため、ロボットの観察と人間がラベル付けしたスキルを、仮想的なプロンプトや人間の割り込みとペアリングする合成ラベル付けデータセットを提案している。これにより、モデルは複雑な指示を解釈して応答する方法を学習できるとしている。

Key Facts

Physical Intelligenceは2025年2月26日にHi Robotを発表した。[1]
Hi Robotはπ0などのVLAモデルを「システム1」として、高次のVLMを「システム2」として用いる2段階推論を採用する。[1]
高レベルポリシーはπ0と同じVLMバックボーンを使用する。[1]
Hi Robotは複雑なプロンプトを中間ステップに分解し、π0に指示を「ささやく」。[1]
Hi Robotはユーザーのリアルタイムなフィードバックを解釈し、シーンに基づいて指示を修正できる。[1]
Physical Intelligenceは、合成ラベル付けデータセットを用いてモデルを訓練することを提案している。[1]
Hi Robotはテーブルバッシングやサンドイッチ作成などの実世界タスクで評価された。[1]

なぜ重要か

Hi Robotは、ロボットが複雑な指示や文脈を理解して行動するための新しい枠組みを提供する。これにより、ロボットの柔軟性と対話性が向上し、実用的なタスクでの応用が期待される。