VLMとは VLM(Vision-Language Model)は、画像や動画などの視覚情報と、テキストや音声などの言語情報を同時に扱うモデルです。大量の画像とテキストのペアデータから、視覚的な概念と単語の意味を対応付けて学習します。

何が重要か VLMは、ロボットに「見る」と「理解する」を結びつける能力を与えます。例えば、ロボットが物体を認識し、その名前や用途を言語で指示されたり、環境の説明を理解して行動したりすることが可能になります。