何が起きたか
研究チームは2024年6月13日、オープンソースの視覚言語行動モデル「OpenVLA」を発表した。同モデルは7Bパラメータで、Llama 2言語モデルとDINOv2・SigLIPの視覚エンコーダを組み合わせ、97万件の実ロボットデモで訓練された。29タスクの評価で、閉じたモデルRT-2-X(55B)を絶対成功率で16.5%上回り、パラメータ数は7分の1としている。
詳細
OpenVLAは、Llama 2言語モデルと、DINOv2とSigLIPの事前学習済み特徴を融合する視覚エンコーダで構成される。97万件の実ロボットデモで訓練され、汎用操作タスクでRT-2-X(55B)を16.5%上回る成功率を達成したとされる。また、スクラッチから学習する模倣学習手法Diffusion Policyを20.4%上回ると報告されている。さらに、低ランク適応(LoRA)によるコンシューマー向けGPUでのファインチューニングや、量子化による効率的な推論が可能で、成功率を損なわないとしている。モデルチェックポイント、ファインチューニング用ノートブック、PyTorchコードベースが公開されている。
Key Facts
| OpenVLAは7BパラメータのオープンソースVLAモデルで、Llama 2言語モデルとDINOv2・SigLIPの視覚エンコーダを組み合わせている。 | [1] |
| OpenVLAは97万件の実ロボットデモで訓練された。 | [1] |
| 29タスクの評価で、OpenVLAはRT-2-X(55B)を絶対成功率で16.5%上回り、パラメータ数は7分の1である。 | [1] |
| OpenVLAはDiffusion Policyを20.4%上回る成功率を達成した。 | [1] |
| モデルチェックポイント、ファインチューニング用ノートブック、PyTorchコードベースが公開されている。 | [1] |
なぜ重要か
OpenVLAの公開は、ロボット操作の基盤モデルを誰でも利用・改良できる環境を整えるものであり、ロボット学習の研究開発を加速させる可能性がある。特に、パラメータ効率の高さとファインチューニングの容易さは、実用化に向けたハードルを下げる点で重要だ。今後の展開として、実世界での応用や安全性の検証が注目される。