何が起きたか

研究チームは、Vision-Language-Action (VLA) モデルが指示の言い換えに対して脆弱である問題を調査し、その根本原因がデータ不足ではなくアーキテクチャにあることを発見した。具体的には、動的な視覚観測とテキストの共同エンコーディングが系統的な特徴シフトを引き起こし、下流の行動ポリシーが意味を正しく制御コマンドに変換できないことが原因である。この問題を解決するため、Grounded Semantic Re-binding (GSR) を提案。独立に抽出したタスク意味とネイティブな視覚特徴を融合し、再初期化した行動エキスパートをゼロから訓練する。この介入により、標準的なデモンストレーションのみで言い換えに対する頑健性を大幅に回復した。LIBERO-Paraベンチマークでは成功率を最大44.6%向上させ、軽量モデルが大規模ベースラインに匹敵する性能を達成。さらに、最先端モデルをPRIDEスコア70.4に押し上げ、最近導入された大規模事前学習モデルXiaomi-Robotics-0を指示生成能力で上回った。また、この知見に基づき、0.33Bパラメータのネイティブに分離されたモデルParaVLAを導入し、指示の言い換えに対してほぼ完全な頑健性を示した。

Key Facts

VLAモデルは指示の言い換えで性能が劇的に低下するが、内部ではタスク同一性を正しく保持していることが判明した。[0]
性能低下の原因は、動的視覚観測とテキストの共同エンコーディングによる系統的な特徴シフトであり、下流の行動ポリシーが意味を制御コマンドに変換できないことにある。[0]
提案手法GSRは、独立に抽出したタスク意味とネイティブな視覚特徴を融合し、再初期化した行動エキスパートをゼロから訓練することで、標準的なデモンストレーションのみで言い換えに対する頑健性を回復する。[0]
LIBERO-ParaベンチマークでGSRは成功率を最大44.6%向上させた。[0]
GSRは最先端モデルをPRIDEスコア70.4に押し上げ、最近導入された大規模事前学習モデルXiaomi-Robotics-0を指示生成能力で上回った。[0]
研究チームは、0.33Bパラメータのネイティブに分離されたモデルParaVLAを導入し、指示の言い換えに対してほぼ完全な頑健性を示した。[0]

なぜ重要か

この研究は、VLAモデルの指示言い換えに対する脆弱性がアーキテクチャに起因することを明らかにし、データスケーリングに頼らない構造的解決策を示した点で重要。GSRは軽量モデルでも大規模モデルに匹敵する性能を実現し、ロボット操作の実用性を高める。また、Xiaomi-Robotics-0を上回るPRIDEスコアを達成したことで、指示生成の新たなベンチマークを確立した。