日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLA/行動表現arXiv:2608.10484v1

再構築の迷子:視覚-言語-行動モデルにおける行動表現と言語の整合

Lost in Reconstruction: Aligning Action Representations with Language in Vision-Language-Action Models

シェア:XThreadsFacebookLINEはてブBluesky

行動軌跡には言語的意味情報が含まれるが、再構築のみのトークン化で失われるため、凍結VLMで指示を復元する補助損失を持つセマンティック整合トークナイザSALTを提案し、言語条件付き制御の成功率を大幅に向上させた。

詳しい要約

1. どんなもの?

本論文は、Vision-Language-Action Models (VLAs) における行動表現の言語的意味の整合性を扱う。行動動詞は物理的結果だけでなく実行方法も記述するが、既存のVLAは生の行動空間でのL1/L2損失による再構成のみで最適化され、数値的近接性が言語的に意味のある区別を反映しない。BridgeV2データセットで、行動軌跡が視覚状態変化を超えた動詞接地情報を含むこと、再構成のみの離散トークン化がこの情報を体系的に消失させることを示す。この問題に対し、VQ-VAEスタイルのトークナイザに補助目的を追加し、凍結したVision-Language Modelが量子化された行動潜在変数からエピソード命令を復元できるようにするSemantically ALigned action Tokenizer (SALT) を導入する。

2. 先行研究と比べてどこがすごい?

先行研究のVLAは行動表現を再構成損失のみで学習し、言語的意味を考慮しない。SALTは、行動トークン化に言語接地を明示的に組み込む点で新規。再構成のみのVQ-VAEトークナイザやFASTと比較して、SimplerEnvでの成功率が大幅に向上(71.9% vs 42.7% vs 31.2%)。また、SALTは動詞特化コードを発達させつつ再構成忠実度を維持することを示し、行動表現と言語の整合が言語条件付き制御を改善することを実証。

3. 技術・手法の肝は?

SALTはVQ-VAEスタイルのトークナイザに補助目的を追加する。具体的には、量子化された行動潜在変数から凍結したVision-Language Modelがエピソード命令を復元できるように学習する。これにより、行動トークンが言語的に意味のある情報を保持するよう促される。再構成損失と言語復元損失を組み合わせて最適化し、行動表現の言語的整合を図る。

4. どうやって有効だと検証した?

BridgeV2データセットで行動軌跡が動詞接地情報を含むことを示し、再構成のみの離散トークン化が情報を消失させることを確認。SimplerEnv環境で、SALTで訓練したポリシーが平均成功率71.9%を達成し、再構成のみのVQ-VAEトークナイザ(42.7%)やFAST(31.2%)を大幅に上回った。また、SALTが動詞特化コードを発達させつつ再構成忠実度を維持することを検証。

5. 議論はある?

要旨からは、SALTの補助目的が言語復元に依存するため、命令が不明確な場合や多様なタスクでの汎用性に限界がある可能性が示唆されるが、詳細は不明。また、凍結したVision-Language Modelの選択や、行動表現と言語の整合が他のタスクや実ロボットに与える影響については要旨からは不明。

6. 次に読むべき論文は?

要旨で参照されている研究として、FAST(おそらく行動トークン化の関連手法)とVQ-VAE(ベースとなるトークナイザ)が挙げられる。また、Vision-Language Model(VLM)の詳細や、言語条件付き制御の関連研究として、既存のVLAモデル(例:RT-2、Octoなど)が関連する可能性があるが、要旨からは特定できない。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Li Wenjie, Yash Jangir, Ignacy Stepka, Yash Agarwal, Marion Kipsang, Yonatan Bisk

分類: cs.RO, cs.AI, cs.CL

原文アブストラクト

Action verbs describe not only the physical outcomes of actions, but also how those actions are performed. Yet action representations in vision-language-action models (VLAs) are typically optimized for reconstruction under L1/L2 losses in raw action space, where numerical proximity need not reflect linguistically meaningful distinctions. On BridgeV2, we show that action trajectories contain verb-grounding information beyond visual state changes, and that reconstruction-only discrete tokenization systematically erodes this information. To address this problem, we introduce SALT, a Semantically ALigned action Tokenizer that augments a VQ-VAE-style tokenizer with an auxiliary objective requiring a frozen vision-language model to recover the episode instruction from quantized action latents. Policies trained with SALT achieve 71.9% average success in SimplerEnv, compared with 42.7% for a reconstruction-only VQ-VAE tokenizer and 31.2% for FAST. SALT also develops verb-specialized codes while maintaining reconstruction fidelity. These results show that robot action trajectories provide a source of language grounding and that preserving this structure in action representations can substantially improve language-conditioned control.