VLAとは
従来は「認識」「計画」「制御」を別々に作っていたロボットの頭脳を、1つのモデルで扱う考え方。カメラ画像と自然言語の指示を入力し、モーターへの動作指令を出力する。
何が嬉しいか
「棚の赤いコップを取って」のような曖昧な指示にも、視覚と言語の理解を通じて対応しやすくなる。
世界のフィジカルAIを、日本語で。
ぶいえるえー
別名: Vision-Language-Action / 行動基盤モデル
「画像を見る」「言葉で指示を理解する」「動作を出力する」を1つにまとめたロボット用AIモデル。
従来は「認識」「計画」「制御」を別々に作っていたロボットの頭脳を、1つのモデルで扱う考え方。カメラ画像と自然言語の指示を入力し、モーターへの動作指令を出力する。
「棚の赤いコップを取って」のような曖昧な指示にも、視覚と言語の理解を通じて対応しやすくなる。
現実世界で身体(ロボットなど)を使って行動するAI。見る・意味を理解する・体を動かすまでを担い、画面の中で完結しない。
週に1度、その週のフィジカルAIをまとめて送ります。重要ニュース5本・日本/中国・Research Picks・今週の公募。無料、いつでも解除できます。