何が起きたか
Googleは、ロボット向けの推論モデル「Gemini Robotics-ER 1.5」を全開発者向けに公開したと発表した。同社によると、これは広く利用可能となった最初のGemini Roboticsモデルであり、ロボットの高水準な推論モデルとして機能する。同モデルは、視覚・空間理解、タスク計画、進捗推定などロボットに重要な能力に特化しており、Google検索などのツールや、視覚・言語・行動モデル(VLA)を含むサードパーティ製のユーザー定義関数をネイティブに呼び出すことができる。開発者は、Google AI StudioとGemini APIを通じてプレビュー版を利用できる。
Key Facts
| Googleは、ロボット向け推論モデル「Gemini Robotics-ER 1.5」を全開発者向けに公開した。 | [0] |
| 同モデルは、広く利用可能となった最初のGemini Roboticsモデルである。 | [0] |
| 同モデルは、視覚・空間理解、タスク計画、進捗推定などロボットに重要な能力に特化している。 | [0] |
| 同モデルは、Google検索などのツールや、視覚・言語・行動モデル(VLA)を含むサードパーティ製のユーザー定義関数をネイティブに呼び出すことができる。 | [0] |
| 開発者は、Google AI StudioとGemini APIを通じてプレビュー版を利用できる。 | [0] |
| 同モデルは、複雑な自然言語コマンドを理解し、長期的なタスクを推論し、洗練された動作を調整できる。 | [0] |
| 同モデルは、高品質な空間結果を生成するためにファインチューニングされており、物体の正確な2Dポイントを生成できる。 | [0] |
なぜ重要か
ロボット向けの高水準な推論モデルが広く開発者に公開されることで、ロボットのタスク計画や環境理解の実装が容易になる可能性がある。同モデルは、インターネット検索や外部関数呼び出しを組み合わせることで、複雑な日常タスクの自動化に貢献すると期待される。