何が起きたか

研究チームは2025年3月16日、arXivプレプリント(論文ID: 2503.12533v2)で、ヒューマノイドロボットエージェント「Being-0」を発表した。Being-0は、基盤モデル(FM)とモジュール型スキルライブラリを統合した階層型エージェントフレームワークで、FMが高レベルの認知タスク(指示理解、タスク計画、推論)を、スキルライブラリが低レベルの制御(安定した移動、器用な操作)を担当する。さらに、軽量な視覚言語モデル(VLM)を搭載したConnectorモジュールが、言語ベースの計画を実行可能なスキルコマンドに変換し、移動と操作を動的に調整する。

詳細

Being-0の設計背景には、基盤モデルと低レベルスキルを直接組み合わせた場合、長期的なタスクでのエラー蓄積やモジュール間のレイテンシ差により、ロバスト性と効率が低下するという問題がある。この課題に対処するため、Being-0はFMとスキルライブラリの間にConnectorモジュールを導入した。Connectorは軽量なVLMで構成され、FMの身体化能力を強化し、言語ベースの計画を具体的なスキルコマンドに変換する。また、移動と操作を動的に調整することでタスク成功率を向上させる。 Being-0の全コンポーネントはFMを除き、低コストのオンボード計算デバイスに展開可能で、フルサイズのヒューマノイドロボット(器用な手とアクティブビジョンを搭載)上で効率的なリアルタイム性能を実現する。大規模な屋内環境での広範な実験により、複雑で長期的なタスク(困難なナビゲーションと操作のサブタスクを含む)の解決における有効性が実証された。詳細や動画はプロジェクトページ(https://beingbeyond.github.io/Being-0)で公開されている。

Key Facts

Being-0は、基盤モデル(FM)とモジュール型スキルライブラリを統合した階層型エージェントフレームワークである。[1]
FMは高レベルの認知タスク(指示理解、タスク計画、推論)を担当する。[1]
スキルライブラリは低レベルの制御(安定した移動、器用な操作)を提供する。[1]
Connectorモジュールは軽量な視覚言語モデル(VLM)で構成され、言語ベースの計画を実行可能なスキルコマンドに変換する。[1]
Connectorは移動と操作を動的に調整し、タスク成功率を向上させる。[1]
FMを除く全コンポーネントは低コストのオンボード計算デバイスに展開可能である。[1]
Being-0はフルサイズのヒューマノイドロボット(器用な手とアクティブビジョンを搭載)でリアルタイム性能を実現する。[1]
大規模な屋内環境での実験で、複雑で長期的なタスクの解決における有効性が実証された。[1]
論文はarXivで2025年3月16日に公開された(論文ID: 2503.12533v2)。[1]

なぜ重要か

Being-0は、基盤モデルと低レベルスキルの統合におけるロバスト性と効率性の課題に対処する新しい階層型フレームワークを提案している。Connectorモジュールによる動的な調整は、長期的なタスクでのエラー蓄積を軽減し、実用的なヒューマノイドエージェントの実現に寄与する可能性がある。