VLAとは 従来は「認識」「計画」「制御」を別々に作っていたロボットの頭脳を、1つのモデルで扱う考え方。カメラ画像と自然言語の指示を入力し、モーターへの動作指令を出力する。

何が嬉しいか 「棚の赤いコップを取って」のような曖昧な指示にも、視覚と言語の理解を通じて対応しやすくなる。