何が起きたか
研究チームは、2025年6月2日にarXivで公開された論文「SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics」において、小型で効率的なコミュニティ駆動型の視覚言語行動モデル(VLA)であるSmolVLAを発表した。SmolVLAは単一GPUでの訓練と、コンシューマー向けGPUやCPUでの展開を可能にし、既存のVLAと比較して訓練・推論コストを大幅に削減する。同モデルは、10倍の規模を持つVLAと同等の性能を達成するとしている。
詳細
従来のVLAモデルは数十億パラメータを持つことが多く、訓練コストが高く、実世界での展開が限られていた。また、学術・産業用データセットに依存しており、手頃なロボットプラットフォームから収集されるコミュニティデータの増加を見落としていた。SmolVLAはこれらの課題に対処するため、小型で効率的な設計を採用し、コミュニティデータを活用する。 SmolVLAは、知覚と行動予測を行動実行から分離する非同期推論スタックを導入し、チャンク化された行動生成により高い制御レートを実現する。研究チームは、シミュレーションおよび実世界のロボットベンチマークでSmolVLAを評価し、コード、事前学習済みモデル、訓練データを公開している。
Key Facts
| SmolVLAは、単一GPUで訓練可能な小型の視覚言語行動モデルである。 | [1] |
| SmolVLAは、コンシューマー向けGPUやCPUでも展開可能である。 | [1] |
| SmolVLAは、既存のVLAと比較して訓練・推論コストを大幅に削減する。 | [1] |
| SmolVLAは、10倍の規模を持つVLAと同等の性能を達成するとしている。 | [1] |
| SmolVLAは、知覚と行動予測を行動実行から分離する非同期推論スタックを導入している。 | [1] |
| SmolVLAは、チャンク化された行動生成により高い制御レートを実現する。 | [1] |
| SmolVLAは、シミュレーションおよび実世界のロボットベンチマークで評価された。 | [1] |
| SmolVLAのコード、事前学習済みモデル、訓練データは公開されている。 | [1] |
なぜ重要か
SmolVLAは、ロボット学習の民主化に貢献する可能性がある。単一GPUでの訓練と低コストな展開を可能にすることで、研究機関や小規模な開発者でも高度なVLAモデルを利用できるようになる。また、コミュニティデータの活用は、ロボット学習のデータソースを拡大し、より多様な環境での適応を促進する。