何が起きたか
2025年11月25日、arXivにプレプリント「MAPS: Preserving Vision-Language Representations via Module-Wise Proximity Scheduling for Better Vision-Language-Action Generalization」が公開された。研究チームは、VLAモデルの微調整時に視覚エンコーダと行動指向の言語層で異なる適応度合いを実現する「MAPS」を提案し、複数のベンチマークで性能向上を報告している。
詳細
MAPSは、モジュールごとに事前学習済みモデルへの近接性制約を線形に緩和するスケジューリング手法である。視覚エンコーダは事前学習の事前分布に近い状態を保ち、行動指向の言語層はより自由に適応できるようにする。追加のパラメータやデータは不要で、既存のVLAモデルにシームレスに統合できる。評価はMiniVLA-VQ、MiniVLA-OFT、OpenVLA-OFTの各モデルに対し、SimplerEnv、CALVIN、LIBEROのベンチマークとFranka Emika Pandaプラットフォームでの実機評価で実施され、分布内・分布外の性能が最大30%向上したと報告されている。
Key Facts
| MAPSは、VLAモデルの微調整時にモジュールごとに近接性制約を線形に緩和する手法である。 | [1] |
| MAPSは追加のパラメータやデータを必要とせず、既存のVLAに統合可能である。 | [1] |
| 評価はMiniVLA-VQ、MiniVLA-OFT、OpenVLA-OFTで実施され、SimplerEnv、CALVIN、LIBERO、Franka Emika Pandaプラットフォームで性能が最大30%向上した。 | [1] |
| 研究チームは、事前学習済みVLMへの近接性を経験的に導出した順序で緩和することが、VLMからVLAへの転移における汎化維持の原則であるとしている。 | [1] |
なぜ重要か
VLAモデルはロボット制御の基盤技術として注目されるが、微調整による汎化性能の劣化が課題だった。MAPSは追加コストなしでこの問題に対処する可能性を示しており、ロボット学習の実用化を後押しする。ただし、効果の再現性や理論的裏付けの検証が今後の焦点となる。