何が起きたか

arXivプレプリント(論文ID: 2608.05738v1)として公開された研究で、VLAモデルに言語能力を付与する新しいフレームワーク「In-Context VLA」が提案された。研究チームは、自由形式のテキストによる思考連鎖(CoT)が低レベル制御を劣化させることを、実証的かつ分析的に示した。その理由として、生成される推論が接地されていないこと、レイテンシがクローズドループのタイミングを壊すこと、推論トークンと行動トークンが相反する目的で最適化されるため、ポリシーが行動ではなく「ナレーション」を学習してしまうことを挙げている。そこで、VLAに必要なのは言語を生成する能力ではなく、接地された言語を消費する能力だと主張し、(i) 知覚的証拠を構造化コンテキストとして注入し、行動のみを教師する「インコンテキスト・ポストトレーニング」と、(ii) オープンボキャブラリ検出器、単眼深度、視覚言語モデルをクエリしてタスク関連情報を能動的に取得する「エージェンティック・ツール使用インターフェース」を導入した。データエンジンは単一のテンプレート化されたキャプションではなく、多様で言い換えられ、証拠に条件付けられた空間記述を生成し、ポリシーが逐語的に見たことのない言語を解釈することを学習する。RoboCasa-GR1、SimplerEnv、LIBEROのシミュレーションベンチマークと、8つの実世界ロボット操作タスクにおいて、CoTベースの手法と同等の設定で比較し、性能と効率の両方で一貫してSOTAを達成した。

Key Facts

自由形式のテキストによる思考連鎖(CoT)は、生成される推論が接地されておらず、レイテンシがクローズドループのタイミングを壊し、推論と行動のトークンが相反する目的で最適化されるため、低レベル制御を劣化させる。[0]
In-Context VLAは、知覚的証拠を構造化コンテキストとして注入し、行動のみを教師するインコンテキスト・ポストトレーニングと、オープンボキャブラリ検出器、単眼深度、視覚言語モデルをクエリするエージェンティック・ツール使用インターフェースを導入する。[0]
データエンジンは、多様で言い換えられ、証拠に条件付けられた空間記述を生成し、ポリシーが逐語的に見たことのない言語を解釈することを学習する。[0]
RoboCasa-GR1、SimplerEnv、LIBEROのシミュレーションベンチマークと8つの実世界ロボット操作タスクで、CoTベースの手法と同等の設定で比較し、性能と効率の両方で一貫してSOTAを達成した。[0]

なぜ重要か

この研究は、VLAモデルにおける言語の役割についての常識を覆すものであり、ロボット操作における言語能力の付与方法に新たな指針を与える。CoTが制御性能を損なうという分析は、今後のVLA設計に重要な示唆を与え、接地された言語を消費する能力に焦点を当てたアプローチが、シミュレーションと実世界の両方で有効であることを示した。