何が起きたか
Hugging Faceは、ロボット向けの小型オープンソースのVision-Language-Actionモデル「SmolVLA」を発表した。同モデルはパラメータ数450Mで、民生ハードウェアで動作する。学習には、lerobotタグが付いた互換ライセンスのオープンソースコミュニティ共有データセットのみを使用した。同社は、SmolVLA-450Mが、シミュレーション(LIBERO、Meta-World)および実機タスク(SO100、SO101)において、より大規模なVLAやACTなどの強力なベースラインを上回る性能を示したとしている。また、非同期推論をサポートし、応答速度が30%向上、タスクスループットが2倍になるとしている。
Key Facts
| Hugging Faceは、ロボット向けの小型オープンソースのVision-Language-Actionモデル「SmolVLA」を発表した。 | [0] |
| SmolVLAはパラメータ数450Mで、民生ハードウェアで動作する。 | [0] |
| 学習には、lerobotタグが付いた互換ライセンスのオープンソースコミュニティ共有データセットのみを使用した。 | [0] |
| 同社は、SmolVLA-450Mが、シミュレーション(LIBERO、Meta-World)および実機タスク(SO100、SO101)において、より大規模なVLAやACTなどの強力なベースラインを上回る性能を示したとしている。 | [0] |
| 同社は、非同期推論をサポートし、応答速度が30%向上、タスクスループットが2倍になるとしている。 | [0] |
なぜ重要か
VLAモデルはロボットの知覚・言語理解・行動予測を統合するが、これまでの進展は大規模な非公開データセットで学習されたプロプライエタリなモデルに限られ、再現や発展が困難だった。SmolVLAはオープンソースで小型・効率的なVLAモデルを提供し、公開データセットのみを使用して民生ハードウェアで学習可能とすることで、VLAモデルへのアクセスを民主化し、汎用ロボットエージェントの研究を加速することを目指す。