何が起きたか
Googleは2025年9月25日、ロボット向けの身体化推論モデル「Gemini Robotics-ER 1.5」を全開発者に公開したと発表した。Googleによると、これはGemini Roboticsモデルとして広く利用可能になった最初のモデルで、高レベルの推論モデルとして機能する。視覚・空間理解、タスク計画、進捗推定に加え、Google SearchやVLA、第三者が定義した関数を呼び出せる。
本紙の見方
今回の発表の新しさは、ロボット向けの「身体化推論モデル」を開発者に広く開いた点にある。一方で、内容の中核は既存のロボット制御そのものではなく、視覚・空間理解、タスク計画、進捗推定、外部ツール呼び出しを束ねる高レベル層に置かれている。つまり、ロボットの腕や走行性能を直接強化する発表ではなく、実行前の判断と実行中の分岐を扱う計算層の公開である。 Google、Gemini 3.5 Flashを公開 エージェントとコーディングで最強モデルに では、Googleがエージェント向けの開発基盤を前面に出していた。今回のGemini Robotics-ER 1.5は、その流れを物理世界に持ち込む動きと読める。ただし、前回は汎用のエージェント基盤、今回はロボットの身体化推論であり、同じ「エージェント」でも適用先が異なる。Googleが推論、ツール呼び出し、API提供を一体で進めている点は連続しているが、ロボットでは実世界の制約が加わるため、ソフトウェアの巧拙だけでは評価しにくい。 業界構造への含意としては、ロボットの価値の重心が、単体の機械性能から、検索・関数・VLAをつなぐ実行層に移りつつある点が大きい。これにより、ロボット本体を作る側だけでなく、基盤モデル、API、実行環境を持つ側の発言力が強まりやすい。一方で、同社が例示したような分別作業の実用化には、地域ルールの取得、物体認識、動作の段取り、失敗時の再計画が一連で機能する必要がある。したがって、次に確認すべき論点は、どの程度のタスク範囲で安定して使えるのか、どのVLAや外部関数と接続できるのか、そして学習済み性能が実機でどこまで再現されるのかである。
なぜ重要か
Googleが開発者向けに公開したことで、ロボット向けの推論層を自前で一から作らずに試せる環境が増える。Googleは、視覚・空間理解やタスク計画に加えて、Google SearchやVLAを呼び出せるとしており、実世界の作業手順を外部情報と結び付ける設計が前提になっている。
日本への影響
日本のロボット開発では、機体や制御だけでなく、外部情報検索やタスク計画を含む上位レイヤーをどう組み込むかが論点になりやすい。Googleが示した構成は、既存のロボット本体に対して推論層を後付けする発想とも重なるため、実機側の安全設計とAPI接続の整合性が日本企業の検討対象になるとみられる。