何が起きたか

Hugging Faceは、ロボット向けの小型オープンソースのVision-Language-Actionモデル「SmolVLA」を発表した。同モデルはパラメータ数450Mで、民生ハードウェアで動作する。学習には、lerobotタグが付いた互換ライセンスのオープンソースコミュニティ共有データセットのみを使用した。同社は、SmolVLA-450Mが、シミュレーション(LIBERO、Meta-World)および実機タスク(SO100、SO101)において、より大規模なVLAやACTなどの強力なベースラインを上回る性能を示したとしている。また、非同期推論をサポートし、応答速度が30%向上、タスクスループットが2倍になるとしている。

Key Facts

Hugging Faceは、ロボット向けの小型オープンソースのVision-Language-Actionモデル「SmolVLA」を発表した。[0]
SmolVLAはパラメータ数450Mで、民生ハードウェアで動作する。[0]
学習には、lerobotタグが付いた互換ライセンスのオープンソースコミュニティ共有データセットのみを使用した。[0]
同社は、SmolVLA-450Mが、シミュレーション(LIBERO、Meta-World)および実機タスク(SO100、SO101)において、より大規模なVLAやACTなどの強力なベースラインを上回る性能を示したとしている。[0]
同社は、非同期推論をサポートし、応答速度が30%向上、タスクスループットが2倍になるとしている。[0]

なぜ重要か

VLAモデルはロボットの知覚・言語理解・行動予測を統合するが、これまでの進展は大規模な非公開データセットで学習されたプロプライエタリなモデルに限られ、再現や発展が困難だった。SmolVLAはオープンソースで小型・効率的なVLAモデルを提供し、公開データセットのみを使用して民生ハードウェアで学習可能とすることで、VLAモデルへのアクセスを民主化し、汎用ロボットエージェントの研究を加速することを目指す。