何が起きたか
Googleは、ロボットの身体性推論に特化したモデル「Gemini Robotics-ER 1.5」を、すべての開発者向けに公開した。これはGemini Roboticsモデルとして初めて広く提供されるもので、ロボットの高次推論モデルとして機能する。プレビュー版はGoogle AI StudioとGemini APIで利用可能。
詳細
Gemini Robotics-ER 1.5は、ロボットに重要な視覚・空間理解、タスク計画、進捗推定などの能力に特化している。また、Google検索などのツールをネイティブに呼び出せるほか、視覚言語行動モデル(VLA)や他のサードパーティ製ユーザー定義関数を呼び出してタスクを実行できる。 同モデルは、ロボットにとって困難なタスク向けに設計されている。例えば、「これらのオブジェクトを堆肥、リサイクル、ゴミの各ゴミ箱に正しく分別できますか?」という指示に対し、ロボットはインターネットで地域のリサイクルガイドラインを調べ、目の前のオブジェクトを理解し、地域のルールに基づいて分別方法を考え、実行する必要がある。Gemini Robotics-ER 1.5は、このような文脈情報と複数ステップを要する日常タスクを処理できる。 Gemini Robotics-ER 1.5は、身体性推論に最適化された初の思考モデルであり、学術ベンチマークと内部ベンチマークの両方で最先端の性能を達成しているとGoogleは述べている。同モデルはロボットの「高次脳」として機能し、複雑な自然言語コマンドを理解し、長期的なタスクを推論し、洗練された行動を調整できる。また、空間結果の生成にファインチューニングされており、オブジェクトの正確な2Dポイントを生成できる。 さらに、ビデオを処理して物理世界の因果関係を理解する能力も備えており、シーン内で何が起こったかを推論できる。例えば、ロボットアームがマーカーやペンを移動するビデオを分析し、タスクの順序やタイムスタンプ間の行動を正確に説明できる。
Key Facts
| Googleは「Gemini Robotics-ER 1.5」をすべての開発者向けに公開した。 | [0] |
| Gemini Robotics-ER 1.5は、Gemini Roboticsモデルとして初めて広く提供される。 | [0] |
| 同モデルは視覚・空間理解、タスク計画、進捗推定などの能力に特化している。 | [0] |
| 同モデルはGoogle検索などのツールをネイティブに呼び出せる。 | [0] |
| 同モデルはVLAやサードパーティ製ユーザー定義関数を呼び出してタスクを実行できる。 | [0] |
| プレビュー版はGoogle AI StudioとGemini APIで利用可能。 | [0] |
| 同モデルは身体性推論に最適化された初の思考モデルとされる。 | [0] |
| 同モデルは学術ベンチマークと内部ベンチマークの両方で最先端の性能を達成したとGoogleは述べている。 | [0] |
| 同モデルは正確な2Dポイントを生成でき、ロボットの3Dセンサーと組み合わせて正確な位置を特定できる。 | [0] |
| 同モデルはビデオを処理して物理世界の因果関係を理解できる。 | [0] |
なぜ重要か
Gemini Robotics-ER 1.5の公開により、開発者はロボットの高次推論に特化したモデルを利用できるようになる。同モデルは複雑なタスクの計画やツール呼び出しを可能にし、ロボットの実世界での応用を促進する可能性がある。