何が起きたか
研究チームは、Vision-Language-Action (VLA) モデルが指示の言い換えに対して脆弱である問題を調査し、その根本原因がデータ不足ではなくアーキテクチャにあることを発見した。具体的には、動的な視覚観測とテキストの共同エンコーディングが系統的な特徴シフトを引き起こし、下流の行動ポリシーが意味を正しく制御コマンドに変換できないことが原因である。この問題を解決するため、Grounded Semantic Re-binding (GSR) を提案。独立に抽出したタスク意味とネイティブな視覚特徴を融合し、再初期化した行動エキスパートをゼロから訓練する。この介入により、標準的なデモンストレーションのみで言い換えに対する頑健性を大幅に回復した。LIBERO-Paraベンチマークでは成功率を最大44.6%向上させ、軽量モデルが大規模ベースラインに匹敵する性能を達成。さらに、最先端モデルをPRIDEスコア70.4に押し上げ、最近導入された大規模事前学習モデルXiaomi-Robotics-0を指示生成能力で上回った。また、この知見に基づき、0.33Bパラメータのネイティブに分離されたモデルParaVLAを導入し、指示の言い換えに対してほぼ完全な頑健性を示した。
Key Facts
| VLAモデルは指示の言い換えで性能が劇的に低下するが、内部ではタスク同一性を正しく保持していることが判明した。 | [0] |
| 性能低下の原因は、動的視覚観測とテキストの共同エンコーディングによる系統的な特徴シフトであり、下流の行動ポリシーが意味を制御コマンドに変換できないことにある。 | [0] |
| 提案手法GSRは、独立に抽出したタスク意味とネイティブな視覚特徴を融合し、再初期化した行動エキスパートをゼロから訓練することで、標準的なデモンストレーションのみで言い換えに対する頑健性を回復する。 | [0] |
| LIBERO-ParaベンチマークでGSRは成功率を最大44.6%向上させた。 | [0] |
| GSRは最先端モデルをPRIDEスコア70.4に押し上げ、最近導入された大規模事前学習モデルXiaomi-Robotics-0を指示生成能力で上回った。 | [0] |
| 研究チームは、0.33Bパラメータのネイティブに分離されたモデルParaVLAを導入し、指示の言い換えに対してほぼ完全な頑健性を示した。 | [0] |
なぜ重要か
この研究は、VLAモデルの指示言い換えに対する脆弱性がアーキテクチャに起因することを明らかにし、データスケーリングに頼らない構造的解決策を示した点で重要。GSRは軽量モデルでも大規模モデルに匹敵する性能を実現し、ロボット操作の実用性を高める。また、Xiaomi-Robotics-0を上回るPRIDEスコアを達成したことで、指示生成の新たなベンチマークを確立した。