何が起きたか

arXivに投稿された論文「Lost in Reconstruction: Aligning Action Representations with Language in Vision-Language-Action Models」において、研究チームは視覚言語行動モデル(VLA)の行動表現が言語と整合していない問題を提起した。行動動詞は動作の物理的結果だけでなく、その実行方法も記述するが、VLAの行動表現は生の行動空間でのL1/L2損失による再構成に最適化されており、数値的な近接性が言語的に意味のある区別を反映するとは限らない。BridgeV2上で、行動軌跡が視覚状態変化を超えた動詞接地情報を含むこと、再構成のみの離散トークン化がこの情報を体系的に侵食することを示した。この問題に対処するため、VQ-VAEスタイルのトークナイザーに、凍結した視覚言語モデルが量子化された行動潜在変数からエピソード指示を復元することを要求する補助目的を追加した、意味的に整合した行動トークナイザー「SALT」を導入した。SALTで訓練されたポリシーはSimplerEnvで平均成功率71.9%を達成し、再構成のみのVQ-VAEトークナイザー(42.7%)やFAST(31.2%)を上回った。また、SALTは再構成忠実度を維持しながら動詞特化コードを発達させた。

Key Facts

研究チームは、VLAモデルの行動表現が言語と整合していない問題を指摘した。[0]
行動動詞は動作の物理的結果だけでなく、その実行方法も記述する。[0]
VLAの行動表現は生の行動空間でのL1/L2損失による再構成に最適化されている。[0]
BridgeV2上で、行動軌跡が視覚状態変化を超えた動詞接地情報を含むことを示した。[0]
再構成のみの離散トークン化は、動詞接地情報を体系的に侵食する。[0]
SALTはVQ-VAEスタイルのトークナイザーに、凍結した視覚言語モデルが量子化された行動潜在変数からエピソード指示を復元する補助目的を追加する。[0]
SALTで訓練されたポリシーはSimplerEnvで平均成功率71.9%を達成した。[0]
再構成のみのVQ-VAEトークナイザーの平均成功率は42.7%、FASTは31.2%だった。[0]
SALTは再構成忠実度を維持しながら動詞特化コードを発達させた。[0]

なぜ重要か

この研究は、ロボットの行動軌跡が言語接地の源を提供し、行動表現にこの構造を保持することで言語条件付き制御を大幅に改善できることを示している。VLAモデルの性能向上に寄与する可能性がある。