何が起きたか

Zenmaは2026年9月1日、ロボット向けの視覚・言語・行動モデル(VLA)のアダプタ『VLA-Adapter-LIBERO-Long-45000』をHugging Face上で公開した。学習データは4万5000件で、ロボット操作のベンチマーク『LIBERO Long』に対応する。ライセンスはMITで、カスタムコードが含まれる。

詳細

このアダプタは、既存のVLAモデル(OpenVLA)に追加して使うアダプタ方式を採用している。Hugging Faceのページでは、transformers、safetensors、feature-extraction、robotics、vision-language-action、vla、libero、vla-adapter、custom_codeなどのタグが付けられている。ライセンスはMITで、地域は米国(us)とされている。

Key Facts

Zenmaは2026年9月1日に『VLA-Adapter-LIBERO-Long-45000』をHugging Faceで公開した。[1]
学習データは4万5000件で、ベンチマーク『LIBERO Long』に対応する。[1]
ライセンスはMITで、カスタムコードが含まれる。[1]

本紙の見方

今回の公開は、ロボット操作におけるVLAモデルの効率的な適応手法として注目される。アダプタ方式は、大規模なVLAモデル全体を再学習するのではなく、軽量なアダプタを追加学習することで、特定のベンチマークやタスクに特化できる。これにより、計算資源やデータの制約がある研究機関や企業でも、高性能なロボット操作モデルを比較的容易に構築できる可能性がある。 特に、LIBERO Longは長期的なタスク遂行を評価するベンチマークであり、4万5000件のデータセットで学習したアダプタがどの程度の性能を発揮するかが焦点となる。ただし、公開ページには性能評価の具体的な数値は記載されておらず、実際の性能はユーザー自身が検証する必要がある。 また、MITライセンスでの公開は、商用利用を含む幅広い活用を可能にする。ロボット分野では、VLAモデルのオープンソース化が進んでおり、今回のアダプタもその流れに沿ったものと言える。ただし、カスタムコードが含まれるため、利用時にはコードの検証が必要となる。 業界構造への含意としては、アダプタ方式の普及が進めば、VLAモデルの基盤を開発する企業と、それを特定タスクに特化させる周辺エコシステムの分業が進む可能性がある。また、データセットの公開が進むことで、ロボット操作の研究開発の参入障壁が下がることも考えられる。 未確定の論点としては、実際の性能評価、対応するロボットプラットフォーム、学習データの内容や収集方法、他のベンチマークへの適用可能性などが挙げられる。これらの情報は公開ページには記載されておらず、今後の追加情報が待たれる。

なぜ重要か

この公開は、ロボット操作AIの開発において、大規模モデルを効率的に特定タスクへ適応させる手法の一例を示す。アダプタ方式とオープンソースの組み合わせは、研究開発のコストを下げ、ロボットAIの応用範囲を広げる可能性がある。