何が起きたか
研究チームは2025年2月27日にarXivで公開した論文で、VLAの微調整における設計選択(行動復号方式、行動表現、学習目的)を体系的に研究し、最適化された微調整レシピ「OFT」を提案した。このレシピをOpenVLAに適用した「OpenVLA-OFT」は、LIBEROシミュレーションベンチマークで平均成功率を76.5%から97.1%に向上させ、行動生成スループットを26倍に増加させた。
詳細
OFTレシピは、並列復号、行動チャンキング、連続行動表現、L1回帰ベースの学習目的を統合し、推論効率・ポリシー性能・入出力仕様の柔軟性を改善する。実世界評価では、バイマニュアルALOHAロボットで器用で高周波な制御タスクを実行し、デフォルトレシピで微調整した他のVLA(π0、RDT-1B)や、スクラッチから訓練した強力な模倣学習ポリシー(Diffusion Policy、ACT)を平均成功率で最大15%ポイント上回った。コードと事前学習済みモデルチェックポイントはhttps://openvla-oft.github.io/で公開されている。
Key Facts
| 研究チームはVLAの微調整における設計選択を研究し、最適化された微調整レシピ「OFT」を提案した。 | 出典一覧 |
| OpenVLA-OFTはLIBEROベンチマークで平均成功率を76.5%から97.1%に向上させた。 | 出典一覧 |
| OpenVLA-OFTは行動生成スループットを26倍に増加させた。 | 出典一覧 |
| 実世界評価では、バイマニュアルALOHAロボットで高周波制御タスクを実行し、他VLAや模倣学習ポリシーを平均成功率で最大15%ポイント上回った。 | 出典一覧 |
| コードと事前学習済みモデルチェックポイントはhttps://openvla-oft.github.io/で公開されている。 | 出典一覧 |
本紙の見方
今回の成果は、VLAの微調整手法に焦点を当てた点で新規性がある。従来のVLA研究はモデルアーキテクチャや事前学習データに注目することが多かったが、微調整の設計選択(行動復号方式、行動表現、学習目的)を体系的に比較し、最適な組み合わせを特定した。OpenVLA-OFTは、既存のOpenVLAをベースにしながらも、微調整レシピの変更だけで成功率を大幅に向上させており、モデル自体の変更を伴わない点で実用的な改善と言える。 本紙の過去報道との接続はないが、VLA分野の進展として、微調整の重要性が再確認された。特に、実世界のロボットタスクで高周波制御が必要な場合、従来の行動表現や復号方式では性能が限られることが示唆される。OFTの連続行動表現とL1回帰は、離散化やクロスエントロピー損失を用いる従来手法よりも、連続的な制御に適しているとみられる。 業界構造への含意として、VLAの実用化には微調整の効率化が鍵となる。ロボットメーカーや研究機関が独自のロボットセットアップにVLAを適用する際、OFTのようなレシピは導入コストを低減する可能性がある。また、行動生成スループットの26倍向上は、実時間制御への応用を後押しする。 未確定の論点としては、OFTが他のVLAモデルや多様なロボットプラットフォームでどの程度汎用性を持つかが挙げられる。今回の実機評価はALOHAロボットに限定されており、他のハードウェアでの検証が待たれる。また、成功率の向上が特定のタスク分布に依存する可能性もあり、より広範なベンチマークでの評価が焦点になる。
なぜ重要か
VLAの微調整は実用化の障壁となっていたが、OFTはそのコストを大幅に削減する可能性を示した。成功率とスループットの向上は、ロボットの実時間制御や複雑なタスクへの応用を現実に近づける。今後のVLA研究は、モデル開発だけでなく、効率的な適応手法の確立が競争力の源泉となるだろう。