VLA(Vision-Language-Action)ぶいえるえー別名: Vision-Language-Action / 行動基盤モデル「画像を見る」「言葉で指示を理解する」「動作を出力する」を1つにまとめたロボット用AIモデル。VLAとは 従来は「認識」「計画」「制御」を別々に作っていたロボットの頭脳を、1つのモデルで扱う考え方。カメラ画像と自然言語の指示を入力し、モーターへの動作指令を出力する。何が嬉しいか 「棚の赤いコップを取って」のような曖昧な指示にも、視覚と言語の理解を通じて対応しやすくなる。関連用語physical-ai← 用語集