何が起きたか
研究チームは2024年6月13日、オープンソースの視覚言語行動モデル「OpenVLA」を発表した。同モデルは7Bパラメータで、Llama 2言語モデルとDINOv2・SigLIPの視覚エンコーダを組み合わせ、97万件の実ロボットデモで訓練された。29タスクの評価で、閉じたモデルRT-2-X(55B)を絶対成功率で16.5%上回り、パラメータ数は7分の1としている。
詳細
OpenVLAは、Llama 2言語モデルと、DINOv2とSigLIPの事前学習済み特徴を融合する視覚エンコーダで構成される。97万件の実ロボットデモで訓練され、汎用操作タスクでRT-2-X(55B)を16.5%上回る成功率を達成したとされる。また、スクラッチから学習する模倣学習手法Diffusion Policyを20.4%上回ると報告されている。さらに、低ランク適応(LoRA)によるコンシューマー向けGPUでのファインチューニングや、量子化による効率的な推論が可能で、成功率を損なわないとしている。モデルチェックポイント、ファインチューニング用ノートブック、PyTorchコードベースが公開されている。
Key Facts
| OpenVLAは7BパラメータのオープンソースVLAモデルで、Llama 2言語モデルとDINOv2・SigLIPの視覚エンコーダを組み合わせている。 | 出典一覧 |
| OpenVLAは97万件の実ロボットデモで訓練された。 | 出典一覧 |
| 29タスクの評価で、OpenVLAはRT-2-X(55B)を絶対成功率で16.5%上回り、パラメータ数は7分の1である。 | 出典一覧 |
| OpenVLAはDiffusion Policyを20.4%上回る成功率を達成した。 | 出典一覧 |
| モデルチェックポイント、ファインチューニング用ノートブック、PyTorchコードベースが公開されている。 | 出典一覧 |
本紙の見方
今回の発表は、ロボット操作分野における基盤モデルのオープンソース化という点で画期的である。従来のVLAモデルはクローズドなものが多く、研究者がアクセスしにくいという課題があった。OpenVLAは7Bパラメータという比較的小規模なモデルでありながら、55BのRT-2-Xを上回る性能を示したことで、パラメータ効率の高さが示された。これは、大規模モデルが必ずしも高性能を意味しないという点で、業界の常識に一石を投じるものだ。また、低ランク適応によるコンシューマー向けGPUでのファインチューニングが可能であることは、ロボット研究の参入障壁を下げる可能性がある。これにより、個々の研究室や中小企業でも、特定のタスクに特化したVLAモデルを開発しやすくなるだろう。一方で、今回の評価はシミュレーションや特定のロボット環境に限られている可能性があり、実世界での汎用性やロバスト性についてはさらなる検証が必要である。また、学習データの多様性やバイアス、安全性に関する議論も今後の焦点となるだろう。
なぜ重要か
OpenVLAの公開は、ロボット操作の基盤モデルを誰でも利用・改良できる環境を整えるものであり、ロボット学習の研究開発を加速させる可能性がある。特に、パラメータ効率の高さとファインチューニングの容易さは、実用化に向けたハードルを下げる点で重要だ。今後の展開として、実世界での応用や安全性の検証が注目される。