何が起きたか

NVIDIAは、ヒューマノイドロボット向けのオープンな推論型Vision-Language-Action(VLA)モデル「Isaac GR00T N1.7」を発表した。このモデルは3Bパラメータで、視覚観測と自然言語命令を連続的なロボット動作にマッピングする。Action Cascadeアーキテクチャを採用し、高レベルの推論(System 2)と低レベルのモーター制御(System 1)を分離している。System 2はCosmos-Reason2-2Bバックボーンを使用し、System 1は32層のDiffusion Transformer(DiT)で構成される。入力はRGB画像、言語命令、ロボットの自己受容状態(関節位置、速度、エンドエフェクタ姿勢)で、出力はロボットの自由度に対応する連続値のアクションベクトルである。Unitree G1、Bimanual Manipulator YAM、AGIBot Genie 1での検証が行われた。

Key Facts

NVIDIAは、ヒューマノイドロボット向けのオープンな推論型VLAモデル「Isaac GR00T N1.7」を発表した。[0]
GR00T N1.7は3Bパラメータのモデルで、Hugging FaceとGitHubで公開され、商用ライセンスが提供される。[0]
GR00T N1.7はAction Cascadeアーキテクチャを採用し、System 2(VLM)とSystem 1(Diffusion Transformer)で構成される。[0]
System 2はCosmos-Reason2-2Bバックボーンを使用し、System 1は32層のDiTで構成される。[0]
GR00T N1.7はUnitree G1、Bimanual Manipulator YAM、AGIBot Genie 1で検証された。[0]
GR00T N1.7はEgoScaleと呼ばれる手法で、20,854時間の人間の一人称視点ビデオで事前学習された。[0]
NVIDIAは、より多くの人間データがロボットの器用さを直接的かつ予測的に向上させる「器用さのスケーリング則」を初めて実証したとしている。[0]

なぜ重要か

このモデルは商用ライセンスで提供されるため、工場などの生産現場での即時導入が可能になるとNVIDIAは説明している。また、人間の一人称視点ビデオを大規模に活用することで、テレオペレーションなしに器用な操作を向上させる可能性を示しており、ヒューマノイドロボットの実用化に向けた重要な一歩となる可能性がある。