何が起きたか
研究チームは2025年2月27日にarXivで公開した論文で、VLAの微調整における設計選択(行動復号方式、行動表現、学習目的)を体系的に研究し、最適化された微調整レシピ「OFT」を提案した。このレシピをOpenVLAに適用した「OpenVLA-OFT」は、LIBEROシミュレーションベンチマークで平均成功率を76.5%から97.1%に向上させ、行動生成スループットを26倍に増加させた。
詳細
OFTレシピは、並列復号、行動チャンキング、連続行動表現、L1回帰ベースの学習目的を統合し、推論効率・ポリシー性能・入出力仕様の柔軟性を改善する。実世界評価では、バイマニュアルALOHAロボットで器用で高周波な制御タスクを実行し、デフォルトレシピで微調整した他のVLA(π0、RDT-1B)や、スクラッチから訓練した強力な模倣学習ポリシー(Diffusion Policy、ACT)を平均成功率で最大15%ポイント上回った。コードと事前学習済みモデルチェックポイントはhttps://openvla-oft.github.io/で公開されている。
Key Facts
| 研究チームはVLAの微調整における設計選択を研究し、最適化された微調整レシピ「OFT」を提案した。 | [1] |
| OpenVLA-OFTはLIBEROベンチマークで平均成功率を76.5%から97.1%に向上させた。 | [1] |
| OpenVLA-OFTは行動生成スループットを26倍に増加させた。 | [1] |
| 実世界評価では、バイマニュアルALOHAロボットで高周波制御タスクを実行し、他VLAや模倣学習ポリシーを平均成功率で最大15%ポイント上回った。 | [1] |
| コードと事前学習済みモデルチェックポイントはhttps://openvla-oft.github.io/で公開されている。 | [1] |
なぜ重要か
VLAの微調整は実用化の障壁となっていたが、OFTはそのコストを大幅に削減する可能性を示した。成功率とスループットの向上は、ロボットの実時間制御や複雑なタスクへの応用を現実に近づける。今後のVLA研究は、モデル開発だけでなく、効率的な適応手法の確立が競争力の源泉となるだろう。