何が起きたか

Google DeepMindは、ロボットの身体化推論に特化したモデル「Gemini Robotics-ER 1.6」を発表した。同モデルは、空間推論とマルチビュー理解を強化し、ロボットが環境をより正確に理解できるようにする。視覚・空間理解、タスク計画、成功検出などの推論能力に特化しており、Google検索や視覚言語行動モデル(VLA)、その他のサードパーティ製ユーザー定義関数をネイティブに呼び出してタスクを実行できる。Gemini Robotics-ER 1.5およびGemini 3.0 Flashと比較して、空間的・物理的推論能力(ポインティング、カウンティング、成功検出など)が大幅に向上したとしている。また、新機能として計器読み取りを追加し、ロボットが複雑なゲージやサイトグラスを読み取れるようにした。これはBoston Dynamicsとの協業を通じて発見されたユースケースであるという。本日より、Gemini APIおよびGoogle AI Studioを通じて開発者向けに提供を開始した。

Key Facts

Google DeepMindは、ロボットの身体化推論に特化したモデル「Gemini Robotics-ER 1.6」を発表した。[0]
同モデルは、空間推論とマルチビュー理解を強化し、ロボットが環境をより正確に理解できるようにする。[0]
同モデルは、視覚・空間理解、タスク計画、成功検出などの推論能力に特化している。[0]
同モデルは、Google検索や視覚言語行動モデル(VLA)、その他のサードパーティ製ユーザー定義関数をネイティブに呼び出してタスクを実行できる。[0]
Gemini Robotics-ER 1.6は、Gemini Robotics-ER 1.5およびGemini 3.0 Flashと比較して、空間的・物理的推論能力(ポインティング、カウンティング、成功検出など)が大幅に向上したと同社はしている。[0]
新機能として計器読み取りを追加し、ロボットが複雑なゲージやサイトグラスを読み取れるようにした。[0]
計器読み取りは、Boston Dynamicsとの協業を通じて発見されたユースケースであると同社はしている。[0]
Gemini Robotics-ER 1.6は、本日よりGemini APIおよびGoogle AI Studioを通じて開発者向けに提供を開始した。[0]

なぜ重要か

ロボットが実世界で役立つためには、指示に従うだけでなく、物理世界について推論する能力が必要とされる。Gemini Robotics-ER 1.6は、空間推論とマルチビュー理解を強化し、計器読み取りなどの新機能を追加することで、ロボットの自律性を高める可能性がある。開発者向けにAPIで提供されることで、ロボット工学の研究開発が加速する可能性がある。