何が起きたか

2025年12月2日にarXivに公開された論文「VLA Models Are More Generalizable Than You Think: Revisiting Physical and Spatial Modeling」は、VLAモデルの汎化性能を再検討し、視点変化に対する脆弱性の主因が空間モデリングの不整合にあると報告した。提案手法により、Liberoデータセットの視点精度が48.5%から87.1%に向上した。

詳細

論文は、VLAモデルが分布内性能は高いが、新規カメラ視点や視覚的摂動下では性能が急激に低下すると指摘。この脆弱性は物理モデリングではなく空間モデリングの不整合に起因すると分析した。対策として、軽量な学習可能な更新で視覚表現を再調整するワンショット適応フレームワークを提案。第一の手法であるFeature Token Modulation(FTM)は、視覚トークンに大域的なアフィン変換を適用し、わずか4KパラメータでLiberoの視点精度を48.5%から87.1%に改善。第二の手法であるFeature Linear Adaptation(FLA)は、ViTエンコーダに低ランク更新を導入し、4.7Mパラメータで90.8%の成功率を達成。これはLoRA規模のファインチューニングに匹敵し、より低コストであるとしている。

Key Facts

VLAモデルは分布内性能は高いが、新規カメラ視点や視覚的摂動下では性能が急激に低下する。[1]
この脆弱性は物理モデリングではなく空間モデリングの不整合に起因すると論文は分析している。[1]
提案されたFTMは、視覚トークンに大域的なアフィン変換を適用し、わずか4KパラメータでLiberoの視点精度を48.5%から87.1%に改善した。[1]
FLAはViTエンコーダに低ランク更新を導入し、4.7Mパラメータで90.8%の成功率を達成した。[1]
論文は、事前学習済みVLAモデルには未活用のロバスト性が存在し、対象を絞った最小限の視覚適応で視点汎化を回復できると結論付けている。[1]

なぜ重要か

この研究は、VLAモデルの実用化における重要な障壁である視点汎化問題に対して、低コストで効果的な解決策を示した。ロボットや自動運転など、カメラ視点が変化する環境での展開を加速する可能性がある。