何が起きたか

Mimic Roboticsは、同社の最新リリースである「mimic-video」において、Video-Action Models(VAM)と呼ばれる新しいクラスのモデルを導入したと発表した。これは、ロボットポリシーを事前学習済み動画モデルに基づかせるものである。同社はブログで、動画モデルのバックボーンは、VLMバックボーンと比較して、ロボット基盤モデルの事前学習にとってより自然な選択肢になり得ると論じている。

Key Facts

Mimic Roboticsは、最新リリース「mimic-video」でVideo-Action Models(VAM)を導入した。[0]
VAMは、ロボットポリシーを事前学習済み動画モデルに基づかせる新しいクラスのモデルである。[0]
同社は、動画モデルのバックボーンがVLMバックボーンよりもロボット基盤モデルの事前学習に自然な選択肢であると主張している。[0]
同社は、VLA(Vision-Language-Action Models)が過去2年間でロボット工学の世界に広く採用されたと述べている。[0]
同社は、pi0やpi0.5などのVLAモデルがPaliGemmaなどの事前学習済みVLMをバックボーンとして使用し、その上にアクションデコーダーを訓練していると説明している。[0]

なぜ重要か

この発表は、ロボット工学における基盤モデルの事前学習の方向性に関する議論を示している。Mimic Roboticsは、従来のVLMバックボーンに代わる動画モデルバックボーンの可能性を提起しており、今後のVLAモデルの設計に影響を与える可能性がある。