ロボット基盤モデル勢力図 — GR00T・Gemini Robotics 2・π0.7・Helix 02・GO-1
重みが公開されていても、商用ライセンスが無ければ製品には載せられない。GO-1はCC BY-NC-SA 4.0、Gemini Robotics 2系は層ごとに配布先が違い、7月に出たτ0-VLAはApache 2.0。オープンかクローズドかではなく、重み・コード・商用可否の3軸で31モデルを分解する。
執筆・編集責任:日本フィジカルAI新聞 編集部
ロボット基盤モデルの勢力図は、性能ではなく重みの配りかたで分けると見通しがよくなる。 誰でもダウンロードできるモデル、APIでしか触れないモデル、自社ロボットの中にしか存在しないモデル。 この違いが、そのままロボットメーカーの戦略の選択肢を決めている。
登録数は本紙AIモデルDBの現在値(自動更新)。学習時間はNVIDIA[8]。
四つの陣営 — 「公開か否か」では足りない#
よく使われるオープン/クローズドの二分では、実務の判断に足りない。重みが公開されていても 商用利用が禁じられていれば製品には載せられないし、重みが出ていなくても提携すれば使える場合がある。重みの公開・コードの公開・商用利用の可否を分けて並べると、勢力図はこうなる。
| モデル | 重み | コード | 商用利用 | ライセンス/配布 |
|---|---|---|---|---|
| GR00T N1.7(NVIDIA) | 公開 | 公開 | 可 | 商用可のライセンスで配布[8] |
| π0 / π0.5(Physical Intelligence) | 公開 | 公開 | 要確認 | openpi で配布[7,11] |
| GO-1(AgiBot) | 公開 | 公開 | 不可 | CC BY-NC-SA 4.0(非商用)[6] |
| π0.7(Physical Intelligence) | 非公開 | 非公開 | — | 公式ブログに公開の記述なし[1] |
| Gemini Robotics 2 系(Google) | 非公開 | 非公開 | 提携先 | ER 2 は AI Studio、VLA と On-Device は早期アクセス提携先[2] |
| Helix 02(Figure) | 非公開 | 非公開 | 不可 | 自社ヒューマノイド専用[3] |
1. 重みを公開し、商用も認める — NVIDIA、大学系
NVIDIAのGR00T N1.7は、2026年4月17日に公開された30億パラメータのVLAで、 Cosmos-Reason2-2Bをバックボーンに32層のDiTで低レベル制御を出力する。 重みはHugging Face、コードはGitHubにあり、商用利用が可能なライセンスで配布されている[8]。 OpenVLA、Octo、SmolVLA、RDT-1B、Diffusion Policyといった大学・コミュニティ発のモデルもこの陣営に属する。 Physical Intelligenceのπ0・π0.5も重みとコードをopenpiに置いている[7,10,11]。
この陣営が存在することの意味は大きい。ロボットメーカーは、自前でモデルを一から学習しなくても、 公開された重みを自社ハードにファインチューニングして製品化できる。日本のスタートアップの多くが取れる現実的な戦略は、いまのところこれである。
2. 重みは出すが、商用では使わせない — AgiBot
AgiBotのGO-1は、重みとコードが公開されている。ただしモデルカードに記載されたライセンスはCC BY-NC-SA 4.0であり、非商用の条件が付く[6]。 「公開されている」と「製品に載せられる」は別だという、この勢力図で最も分かりやすい例である。 研究や評価には自由に使えるが、そのまま出荷はできない。
3. アクセスだけ貸す — Google DeepMind
Googleは2026年7月30日に Gemini Robotics 2 を発表し、系列を三層に分けた[2]。 動作を出力するVLAの Gemini Robotics 2、多段タスクの計画と人との対話を担う推論モデル Gemini Robotics ER 2、そしてロボット本体でローカル実行する Gemini Robotics On-Device 2 である[2]。
配布の仕方も一様ではない。ER 2 は Google AI Studio で利用でき、 Gemini Enterprise Agent Platform ではプライベートプレビューとして提供される。 一方でVLAとOn-Device版は「early-access partners」向けとされている[2]。同じGoogleの中に、開発者が触れる層と、提携先しか触れない層が同居している。 重みを配らない点は共通だが、「APIで貸す」の一言では実態を捉えられない。
4. 出さない — Figure、そしてPhysical Intelligenceの最新世代
FigureのHelix 02は2026年1月27日の公開で、上半身の操作だけでなく歩行・接触・全身の協調までを ひとつの神経系で扱うと説明されている。公式は「A single neural system that controls the full body directly from pixels」と書き、4分間の自律タスクを挙げている[3]。自社ヒューマノイド専用で、 外部への配布はない。
Physical Intelligenceは事情が違う。同社は自社でヒューマノイドを売る会社ではないため、 「自社ロボットに閉じる」という説明は当たらない。実態は世代で線を引いていることだ。 π0とπ0.5はopenpiに重みが置かれている[7,11]一方、 2026年4月のπ0.7は公式ブログに重み・コードの公開に関する記述がなく、論文へのリンクと問い合わせ先だけが示されている[1]。 「最新は出さず、一世代前を公開する」という、言語モデルの世界で見慣れた形に近づいている。
5. どちらとも言えない — Skild、1X、ByteDance
この分類に入れられない勢力がある。Skild AIの Skild Brain は 「any robot, any task, one brain」を掲げるomni-bodiedな基盤モデルで、 2026年3月にABB Robotics、Universal Robots、NVIDIAとの提携を発表している[5]。 1XのRedwood AIは、自社ヒューマノイドNEO向けに移動と操作を同一モデルで扱う。 ByteDance Seedの GR-3 は双腕・長期タスクを扱い、少量の人間の軌跡データで ファインチューニングできるとされる。
いずれも重みとコードの扱いを公式に明示していない。 本紙は分からないものを「公開」にも「非公開」にも入れない方針を取り、 一覧でもバッジを付けていない。勢力図を描くうえで、この空白自体が現在地である。 なお日本語圏では、Fourierの介護向けヒューマノイド「GR-3」と名称が衝突する点に注意が要る。 両者は別物である。
登録モデル一覧(自動更新)#
以下は本紙AIモデルDBの登録内容をそのまま表示している。 陣営の割り当てのみ編集部が付与した。
| 公開 | モデル | 開発 | 種別 | 配布形態 |
|---|---|---|---|---|
| 2026年7月 | Gemini Robotics 2 | Google DeepMind | VLA | API提供 |
| 2026年7月 | Gemini Robotics ER 2 | Google DeepMind | VLM (embodied reasoning) | API提供 |
| 2026年7月 | Gemini Robotics On-Device 2 | Google DeepMind | VLA (オンデバイス) | 自社限定 |
| 2026年7月 | τ0-VLA | — | VLA (階層型+世界モデル) | 重み公開 |
| 2026年4月 | NVIDIA Isaac GR00T N1.7 | NVIDIA | VLA・ヒューマノイド基盤(推論強化・指制御・商用可) | 重み公開 |
| 2026年4月 | Physical Intelligence π0.7 | Physical Intelligence | 汎用VLA(操作可能・創発的な合成汎化) | 自社限定 |
| 2026年3月 | Skild Brain | — | VLA (omni-bodied) | — |
| 2026年1月 | Figure Helix 02 | Figure | VLA (全身) | 自社限定 |
| 2025年11月 | Physical Intelligence π*0.6 | — | VLA・経験からの改善 | — |
| 2025年9月 | Gemini Robotics 1.5 | Google DeepMind | VLA + ER(身体的推論) | API提供 |
| 2025年7月 | ByteDance GR-3 | ByteDance Seed | VLA (双腕・移動) | — |
| 2025年6月 | Meta V-JEPA 2 | — | 世界モデル(動画自己教師) | 重み公開 |
| 2025年6月 | SmolVLA | — | 小型・省コストVLA | 重み公開 |
| 2025年5月 | NVIDIA Isaac GR00T N1.5 | NVIDIA | VLA・ヒューマノイド基盤(2段階System1/2) | 重み公開 |
| 2025年4月 | Physical Intelligence π0.5 | Physical Intelligence | VLA(オープンワールド汎化) | 重み公開 |
| 2025年3月 | OpenVLA-OFT | UC Berkeley | OpenVLAの微調整強化版 | 重み公開 |
| 2025年3月 | NVIDIA Isaac GR00T N1 | NVIDIA | VLA・ヒューマノイド基盤モデル | 重み公開 |
| 2025年3月 | Gemini Robotics / Robotics-ER | Google DeepMind | VLA(Gemini基盤・空間推論ER) | API提供 |
| 2025年3月 | AgiBot GO-1 (Genie Operator-1) | AgiBot | ViLLA(Vision-Language-Latent-Action) | 重み公開/非商用 |
| 2025年2月 | Figure Helix | Figure | VLA (humanoid) | 自社限定 |
| 2025年2月 | Physical Intelligence π0-FAST | — | 自己回帰VLA | — |
| 2025年1月 | NVIDIA Cosmos | NVIDIA | 世界基盤モデル(物理シミュ生成) | 重み公開 |
| 2024年12月 | Google DeepMind Genie 2 | Google DeepMind | 世界モデル(操作可能な環境生成) | API提供 |
| 2024年10月 | Physical Intelligence π0 (pi-zero) | Physical Intelligence | 汎用VLA(フローマッチング) | 重み公開 |
| 2024年10月 | RDT-1B (Robotics Diffusion Transformer) | Tsinghua University | 拡散ベース双腕VLA | 重み公開 |
| 2024年6月 | OpenVLA | UC Berkeley | VLA (open) | 重み公開 |
| 2024年5月 | Octo | UC Berkeley | generalist policy | 重み公開 |
| 2023年10月 | Open X-Embodiment / RT-X | Google DeepMind | 大規模横断データセット+汎用方策 | 重み公開 |
| 2023年7月 | Google RT-2 | Google DeepMind | VLA | 自社限定 |
| 2023年4月 | LeRobot ACT | — | imitation policy | 重み公開 |
| 2023年3月 | Diffusion Policy | UC Berkeley | 拡散モデルによる行動生成 | 重み公開 |
| 2022年12月 | Google RT-1 | Google DeepMind | ロボットTransformer(初代) | 自社限定 |
| — | 1X Redwood AI | 1X | VLA (移動+操作) | 自社限定 |
| — | GigaBrain 0.7 | — | VLA | — |
| — | LingBot-VLA | — | VLA | — |
| — | LingBot-VLA 2.0 | — | VLA・全身操作 | — |
| — | MolmoAct2 SO-100/101 | — | VLA(機体別調整) | — |
| — | MolmoAct 7B-D | — | VLA・行動推論 | — |
| — | NVIDIA Isaac GR00T N1.6 | — | VLA | — |
| — | RynnBrain 1.1 2B | — | 身体性VLM・空間推論 | — |
| — | X-VLA 0.9B | — | VLA | — |
競争の土台は、データの共有にある#
この分野が短期間で立ち上がった理由のひとつは、データを共有する文化が最初にできたことだ。 2023年のOpen X-Embodimentは、21機関が参加し、22種類のロボットから527のスキル、 16万266のタスクを集めた共同データセットである[9]。 異なるロボットのデータで学習したモデルが、互いの性能を押し上げるという結果が示されたことで、 「一社では集めきれない」という前提が業界の共通認識になった。
勢力図として見たとき、「最新世代・大規模・商用利用可」を同時に満たす公開モデルは、 長らくNVIDIAのGR00Tがほぼ唯一だった。重みが公開されたモデル自体は少なくない—— GO-1もπ0.5もSmolVLAもある。だが GO-1 は非商用ライセンスで製品に載せられず[6]、 Physical Intelligenceは最新のπ0.7を出していない[1]。 条件を三つ重ねた瞬間に、選択肢は急に細る。重みが公開されたモデル自体は少なくない——GO-1もπ0.5もSmolVLAもある。 だが GO-1 は非商用ライセンスで製品に載せられず[6]、 Physical Intelligenceは最新のπ0.7を出していない[1]。 条件を三つ重ねた瞬間に、選択肢は急に細る。 GPUを売る立場のNVIDIAにとって、ロボット基盤モデルを無料で配ることは合理的だが、 それは同社の事業戦略が変われば止まりうるということでもある。
ただしこの構図は2026年7月に崩れ始めた。sii-researchが公開したτ0-VLAは、 40,115時間の異種実世界データで学習した階層型モデルで、コードと重みをApache 2.0で公開している[4]。 非商用でも提携限定でもない、条件を三つとも満たす二例目である。 単独供給への依存を心配する側にとって、選択肢が一つ増えたことの意味は小さくない。
ロボットメーカーの側から見た実務的な結論はこうだ。 いま公開モデルの上に製品を組むのは正しい。ただし、モデル供給者が一社に偏っている前提でリスクを見積もるべきである。 自社の現場データが、供給者を乗り換えられる形で手元に残っているか—— それが、この勢力図のなかで唯一コントロールできる変数になる。
この図に、2026年から日本が入ってくる
ここまでの勢力図に日本の名前は出てこない。それは2026年前半までの事実である。 ただし経済産業省のFRONTiaプロジェクトが2026年度だけで約3,873億円、 5年で最大1兆円規模の投資を始め[12]、 開発を担うNoetra株式会社にはソニーグループ・ソフトバンク・日本電気・本田技研工業を中核に 計44社が出資している[13]。 2028年6月には約27,500基のNVIDIA Rubin GPUで計算基盤を稼働させる計画である[13]。
ただし本稿の分類軸——重みをどう配るか——で言えば、 Noetraはまだ位置づけられない。モデルが出ていないからだ。 公開するのか、APIで貸すのか、参加企業に限定するのか。 そこが決まったとき初めて、この勢力図に日本の列が加わる。 経緯はNoetraと国家プロジェクトFRONTiaにまとめた。
出典
- 1.π0.7: a Steerable Model with Emergent Capabilities — Physical Intelligence(公式ブログ)、2026-04-16一次情報
- 2.Gemini Robotics 2 brings whole body intelligence to robots — Google DeepMind(公式ブログ)、2026-07-30一次情報
- 3.Introducing Helix 02: Full-Body Autonomy — Figure AI(公式)、2026-01-27一次情報
- 4.τ0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation — sii-research(GitHub)、2026-07-27一次情報
- 5.The Reindustrial Revolution: Partnering with ABB Robotics, Universal Robots, and NVIDIA — Skild AI(公式ブログ)、2026-03-19一次情報
- 6.agibot-world/GO-1(モデルカード。ライセンス表記) — Hugging Face / AgiBot一次情報
- 7.Physical-Intelligence/openpi(π0 のコードと重み) — GitHub / Physical Intelligence一次情報
- 8.NVIDIA Isaac GR00T N1.7: Open Reasoning VLA Model for Humanoid Robots — NVIDIA(Hugging Face 公式ブログ)、2026-04-17一次情報
- 9.Open X-Embodiment: Robotic Learning Datasets and RT-X Models — arXiv:2310.08864、2023-10-13一次情報
- 10.π0: A Vision-Language-Action Flow Model for General Robot Control — arXiv:2410.24164、2024-10-31一次情報
- 11.π0.5: a Vision-Language-Action Model with Open-World Generalization — arXiv:2504.16054、2025-04-22一次情報
- 12.フィジカルAI向けに経産省が3873億円投資、Noetraなどから成るFRONTiaプロジェクトが始動 — 日経Robotics、2026-08-10
- 13.国産マルチモーダル基盤モデルの開発に向けて本格始動 — ソフトバンク(公式プレスリリース)、2026-07-16一次情報
- 14.Google DeepMind introduces on-device Gemini AI model for robots — The Robot Report
週刊ニュースレター
今週のフィジカルAIを日本語で。重要ニュース5本・日本/中国・Research Picks・今週の公募。無料、いつでも解除できます。
同じテーマのコラム
- AGIBOT GE-Act 2.0 — 学習データを増やすと、ロボットはどこまで伸びるか
AGIBOTはGE-Act 2.0で、学習データの拡大に伴う操作成功率の改善を報告した。追加学習なしの評価が示す意味と、現場への導入前に確かめたい条件を整理する。
- BRIDGEを詳しく読む — 1,500ドル級ヒューマノイドの形と制御は、どう一緒に設計されたか
人の動きを写しやすい形と、実際に動かせる駆動系を往復して設計するBRIDGE。腰の自由度、モーター選定、失敗からの設計変更、比較実験を読み解き、報告コストと公開済みCAD・公開予定コードの違いまで確認する。
- SmoothRLから読む実機RL — 何を学習し、どう実装し、どこで失敗するのか
AstribotのSmoothRLは、推論と動作が並行する実機で、採用された行動と学習対象のずれを扱う。成功率の改善と評価条件を確認し、実機RLを支える人間介入、報酬、リセット、ログ、導入時の検証まで整理する。
- VLAは本当に工場で使えるのか
デモの成功率と、工場が求める歩留まりの間には桁の違いがある。Siemensの実地検証とBMWの1250時間から、いま何ができて何ができないのかを切り分ける。
本コラムは編集部が執筆しています。掲載した数値・固有名詞は原典で照合し、確認できないものは掲載していません。 誤りの指摘は歓迎します。関連する自動生成のニュースはニュースへ。