何が起きたか

NVIDIAのブログは、WAMを「事前学習済みのビデオ/ワールドモデルのバックボーンを事前分布として利用し、将来の状態とロボットのアクションの両方を予測するモデル」と定義する。初期のWAMであるUniPiは2023年に提案されたが、主流になるまで数年を要した。現在のWAMの例として、NVIDIAのDreamZeroとCosmos Policy、Ant GroupのLingBot-VA、Rhoda AIのDVA、SereactのCortex 2.0、Mimic Roboticsのmimic-videoが挙げられている。

なぜ重要か

NVIDIAは、事前学習した動画モデルを土台に将来の状態とロボットの行動を同時に予測する「世界行動モデル」を示し、従来の視覚言語モデル型とは別の設計を整理した。これにより、ロボット向け基盤モデルでどの事前学習を出発点にするかを検討する研究者や開発者は、入力と出力の違いを具体的に比較できる。