何が起きたか
arXivに掲載された研究(2025年10月29日付)で、Vision-Language-Action(VLA)モデルの微調整が視覚表現を劣化させることが明らかにされた。研究チームは隠れ表現のプローブとアテンションマップ解析を通じてこの現象を特徴づけ、視覚表現の整合戦略を評価した。
詳細
研究チームは、VLAモデルの微調整中に元の視覚言語(VL)表現と知識がどの程度保持されるかを体系的に調査した。ナイーブな行動微調整が視覚表現の劣化を引き起こすことを示し、VLAモデルと対応するVLMを対比するタスクと手法を設計して、行動微調整によるVL能力の変化を分離した。さらに、視覚表現を整合させる複数の戦略を評価し、劣化を軽減してOODシナリオへの汎化を向上させる簡便な手法を導入した。コードはhttps://blind-vla-paper.github.ioで公開されている。
Key Facts
| 研究チームは、VLAモデルの微調整中に元のVL表現と知識がどの程度保持されるかを体系的に調査した。 | [1] |
| ナイーブな行動微調整が視覚表現の劣化を引き起こすことを示した。 | [1] |
| VLAモデルの隠れ表現をプローブし、アテンションマップを解析した。 | [1] |
| 視覚表現を整合させる戦略を評価し、劣化を軽減してOOD汎化を向上させる簡便な手法を導入した。 | [1] |
| コードはhttps://blind-vla-paper.github.ioで公開されている。 | [1] |
なぜ重要か
VLAモデルの実用化には、行動学習と視覚言語能力の両立が不可欠である。本研究はそのトレードオフを可視化し、改善手法を提供することで、ロボットの汎化性能向上に寄与する可能性がある。開発者にとっては、微調整時の表現劣化を意識した設計が重要になる。