何が起きたか

ボストン・ダイナミクスは自社ブログで、SpotがGoogleの視覚言語モデル「Gemini Robotics-ER 1.5」を使い、住宅内で靴や空き缶を拾うデモを行ったと説明した。同社は、このデモでは会話形式の指示をもとにSpotが画像を確認し、移動や把持などの動作を組み立てたとしている。