何が起きたか

研究チームは2024年6月13日、オープンソースの視覚言語行動モデル「OpenVLA」を発表した。同モデルは7Bパラメータで、Llama 2言語モデルとDINOv2・SigLIPの視覚エンコーダを組み合わせ、97万件の実ロボットデモで訓練された。29タスクの評価で、閉じたモデルRT-2-X(55B)を絶対成功率で16.5%上回り、パラメータ数は7分の1としている。

詳細

OpenVLAは、Llama 2言語モデルと、DINOv2とSigLIPの事前学習済み特徴を融合する視覚エンコーダで構成される。97万件の実ロボットデモで訓練され、汎用操作タスクでRT-2-X(55B)を16.5%上回る成功率を達成したとされる。また、スクラッチから学習する模倣学習手法Diffusion Policyを20.4%上回ると報告されている。さらに、低ランク適応(LoRA)によるコンシューマー向けGPUでのファインチューニングや、量子化による効率的な推論が可能で、成功率を損なわないとしている。モデルチェックポイント、ファインチューニング用ノートブック、PyTorchコードベースが公開されている。

Key Facts

OpenVLAは7BパラメータのオープンソースVLAモデルで、Llama 2言語モデルとDINOv2・SigLIPの視覚エンコーダを組み合わせている。[1]
OpenVLAは97万件の実ロボットデモで訓練された。[1]
29タスクの評価で、OpenVLAはRT-2-X(55B)を絶対成功率で16.5%上回り、パラメータ数は7分の1である。[1]
OpenVLAはDiffusion Policyを20.4%上回る成功率を達成した。[1]
モデルチェックポイント、ファインチューニング用ノートブック、PyTorchコードベースが公開されている。[1]

なぜ重要か

OpenVLAの公開は、ロボット操作の基盤モデルを誰でも利用・改良できる環境を整えるものであり、ロボット学習の研究開発を加速させる可能性がある。特に、パラメータ効率の高さとファインチューニングの容易さは、実用化に向けたハードルを下げる点で重要だ。今後の展開として、実世界での応用や安全性の検証が注目される。