何が起きたか

NVIDIAは2025年3月18日、ヒューマノイドロボット向けのオープン基盤モデル「GR00T N1」を発表した。同モデルはVision-Language-Action(VLA)モデルで、視覚と言語指示を解釈するSystem 2と、リアルタイムで滑らかなモーター動作を生成するSystem 1の二重システムアーキテクチャを採用する。NVIDIAは、同モデルをFourier GR-1ヒューマノイドに搭載し、言語条件付き両腕操作タスクで高い性能とデータ効率を達成したとしている。

詳細

GR00T N1は、視覚と言語指示を通じて環境を解釈するビジョン言語モジュール(System 2)と、拡散トランスフォーマーモジュール(System 1)が密に結合し、エンドツーエンドで共同トレーニングされる。トレーニングには、実ロボットの軌跡、人間のビデオ、合成生成データセットの異種混合を使用する。標準的なシミュレーションベンチマークにおいて、複数のロボット形態で最先端の模倣学習ベースラインを上回る性能を示したとしている。

Key Facts

NVIDIAは2025年3月18日にGR00T N1を発表した。[1]
GR00T N1はVision-Language-Action(VLA)モデルで、二重システムアーキテクチャを採用する。[1]
GR00T N1はFourier GR-1ヒューマノイドに搭載され、言語条件付き両腕操作タスクで高い性能を達成した。[1]
トレーニングには実ロボットの軌跡、人間のビデオ、合成生成データセットを使用する。[1]
標準的なシミュレーションベンチマークで最先端の模倣学習ベースラインを上回った。[1]

本紙の見方

今回の発表は、ヒューマノイドロボットの知能基盤をオープンソース化する点で画期的だ。GR00T N1はVLAモデルであり、視覚と言語を入力として動作を生成する。二重システムアーキテクチャは、システム2が環境解釈、システム1が動作生成を担い、これらをエンドツーエンドで訓練する点が特徴的である。 本紙の過去報道では、2025年2月27日にTrendForceがヒューマノイドロボットを米中対立の次の戦場と分析し、米国はAIエコシステム、中国はサプライチェーン構築に強みを持つと指摘した。今回のNVIDIAのGR00T N1は、まさに米国のAIエコシステムの一環であり、オープン基盤モデルとして提供することで、世界中のロボット開発者が利用できるようにする戦略とみられる。 また、2025年9月12日にはBASFとFourier Intelligenceが材料開発でMoUを締結しており、Fourierはハードウェアと材料の両面でエコシステムを構築している。今回のGR00T N1のFourier GR-1への搭載は、ソフトウェア基盤とハードウェアの連携を示すものであり、ヒューマノイドの実用化に向けた垂直統合の動きと捉えられる。 業界構造への含意として、オープン基盤モデルの登場は、各社が独自にAIモデルを開発する必要性を低減させ、ロボット開発の参入障壁を下げる可能性がある。一方で、データの質と量が競争力を左右するため、実世界データの収集能力が重要になる。 未確定の論点としては、GR00T N1の具体的なパラメータ数や、Fourier GR-1以外のロボットへの展開、実環境での性能検証が挙げられる。また、オープンソース化のライセンス条件や商用利用の制限も今後の焦点となる。

なぜ重要か

NVIDIAがヒューマノイド向けのオープン基盤モデルを公開したことで、ロボット開発のソフトウェア基盤が標準化される可能性がある。これは、ハードウェア開発に注力する企業にとっては追い風となり、AIモデル開発に注力する企業にとっては競争環境の変化を意味する。

日本への影響

日本のロボット産業は、ハードウェアの強みを持つが、AIソフトウェア基盤では海外勢に遅れを取る可能性がある。GR00T N1のようなオープン基盤モデルを活用することで、日本のロボットメーカーは自社開発の負担を軽減し、応用開発に注力できる可能性がある。