何が起きたか

Figureは、ヒューマノイドロボット向けの汎用Vision-Language-Action(VLA)モデル「Helix」を発表した。Helixは、知覚、言語理解、学習された制御を統合し、ロボット工学における複数の長年の課題を克服することを目指す。同社は、Helixが複数の「初めて」を実現したとしている。具体的には、上半身全体(手首、胴体、頭部、個々の指)の高速連続制御を出力する初のVLAであること、2台のロボットで同時に動作し、未見のアイテムを使った共有の長期的操作タスクを解決する初のVLAであること、自然言語のプロンプトに従って、これまで遭遇したことのない何千ものアイテムを含む、ほぼすべての小さな家庭用物体を把持できること、タスク固有の微調整なしにすべての行動を学習する単一のニューラルネットワーク重みセットを使用すること、低消費電力の組み込みGPU上で完全に動作し、商用展開にすぐに対応できる初のVLAであること、などが挙げられる。Figureは、家庭はロボット工学にとって最大の課題であり、現在のロボット工学の状態は、家庭でのスケーリングには不十分だと説明する。新しい行動を教えるには、博士レベルの専門家による手動プログラミングか、数千のデモンストレーションが必要であり、どちらも高コストだと同社は指摘する。Helixは、Vision Language Models(VLM)の豊かな意味知識をロボットの行動に直接変換することで、この問題に対処するという。

Key Facts

Figureは、ヒューマノイド制御用の汎用Vision-Language-Action(VLA)モデル「Helix」を発表した。[0]
Helixは、手首、胴体、頭部、個々の指を含むヒューマノイド上半身全体の高速連続制御を出力する初のVLAであるとFigureは主張している。[0]
Helixは、2台のロボットで同時に動作し、未見のアイテムを使った共有の長期的操作タスクを解決する初のVLAであるとFigureは主張している。[0]
Helixを搭載したFigureのロボットは、自然言語のプロンプトに従って、未遭遇の何千ものアイテムを含む、ほぼすべての小さな家庭用物体を把持できるとFigureは主張している。[0]
Helixは、タスク固有の微調整なしにすべての行動を学習する単一のニューラルネットワーク重みセットを使用する。[0]
Helixは、低消費電力の組み込みGPU上で完全に動作し、商用展開にすぐに対応できる初のVLAであるとFigureは主張している。[0]
Figureは、家庭はロボット工学にとって最大の課題であり、現在のロボット工学の状態は家庭でのスケーリングには不十分だと説明している。[0]
Figureは、新しい行動を教えるには博士レベルの専門家による手動プログラミングか数千のデモンストレーションが必要であり、どちらも高コストだと指摘している。[0]
Helixは、Vision Language Models(VLM)の意味知識をロボットの行動に直接変換することを目指している。[0]

なぜ重要か

Helixは、ヒューマノイドロボットの制御におけるVLAモデルの進歩を示すものであり、家庭環境での汎用ロボットの実用化に向けた一歩となる可能性がある。Figureは、Helixが単一のニューラルネットワークで多様な行動を学習し、低消費電力のGPU上で動作することで、商用展開に適していると主張しており、ロボットのスケーリングに関する課題への対応が注目される。