何が起きたか
Boston Dynamicsは、同社の四足歩行ロボットSpotが、住宅のリビングルームで靴や空き缶を拾う様子を捉えた動画を公開した。このデモは、Googleの視覚言語モデル(VLM)であるGemini Robotics-ER 1.5がSpotに身体的推論(embodied reasoning)をもたらすことで実現した。同社は、2025年のハッカソンで、大規模言語モデル(LLM)と視覚基盤モデル(VFM)を用いた先行プロジェクトを基に、このデモを開発した。従来のソフトウェアロジックやステートマシンを書く代わりに、会話言語でGemini Roboticsと対話し、それがSpotに指示を伝えた。SpotのSDKを用いて、Gemini RoboticsとSpotのAPI間のやり取りを仲介するレイヤーを開発した。APIは通常、開発者がロボットの機能にアクセスしてカスタムアプリケーションや動作を作成するためのものだ。同社は、Gemini Roboticsに、カメラとロボットアームを備えた移動ロボットにアクセスできると伝え、ロボットを制御するための有限のツールセットを与えた。ツールは、内部ロジックを実行し、Gemini Roboticsからの入力を実際のAPI呼び出しに変換する軽量スクリプトである。動作は、場所間の移動、画像のキャプチャ、オブジェクトの識別、把持、別の場所への配置に限定された。同社は、ベースラインのプロンプト作成には学習曲線があり、「オブジェクトを置く」や「写真を撮る」といった単純な指示では期待通りの動作が得られず、各ツールの説明に文脈を追加する必要があったと述べている。
Key Facts
| Boston Dynamicsは、Spotが住宅内で靴や空き缶を拾う動画を公開した。 | [0] |
| このデモでは、Googleの視覚言語モデルGemini Robotics-ER 1.5がSpotに身体的推論をもたらした。 | [0] |
| デモは2025年のBoston Dynamicsのハッカソンで開発された。 | [0] |
| 同社は、SpotのSDKを用いてGemini RoboticsとSpotのAPI間のやり取りを仲介するレイヤーを開発した。 | [0] |
| 同社は、自然言語のプロンプトでGemini Roboticsと対話し、従来のプログラミングに比べ時間を大幅に節約できたとしている。 | [0] |
| 同社は、ベースラインのプロンプト作成には学習曲線があり、単純な指示では期待通りの動作が得られなかったと述べている。 | [0] |
なぜ重要か
このデモは、AIモデルがロボット工学にもたらす可能性を示している。従来のプログラミングに代わり、自然言語でロボットを制御できるようになることで、ロボットの柔軟な活用が進む可能性がある。