何が起きたか

arXivは2026-10-05、論文「Encoded but Not in Control: Revealing the Grounding Gap in Vision-Language Robot Policies」を公開した。論文は、同じ場面を保ったまま指示文だけを差し替える介入で、視覚言語行動モデル(VLA)と世界行動モデル(WAM)を模擬環境と実世界実験で評価した。結果として、指示が別の可視対象を求める場合でも、評価した政策は原場面に結びついた元の対象へ向かい、拾う傾向が強かった。

詳細

論文は、(a) 成功したタスク実行が指示追従を意味するか、(b) 失敗は言語非感受性に由来するのか、(c) それでも符号化された言語がなぜ行動を制御しないのか、という3点を検証した。層ごとの action lens では中間層の行動予測は指示の変化に反応し、線形プローブは指示された対象を高精度に復元できた一方、注意解析では行動生成に対する指示トークンの寄与が弱く、対象トークンの注意が元の対象に残る場合があった。 さらに、UMAP と shared non-negative matrix factorization により、対象情報は依然として表現内でアクセス可能だが、その表現は場面の同一性により強く組織化されていることを示した。論文は、このずれを「grounding gap」と呼び、進歩の基準として、場面側の振る舞いに反する有効な指示変更でも政策が確実に従うことを挙げた。

Key Facts

arXivは2026-10-05に論文「Encoded but Not in Control: Revealing the Grounding Gap in Vision-Language Robot Policies」を公開した。[1]
論文は視覚言語行動モデル(VLA)と世界行動モデル(WAM)を、模擬環境と実世界実験の両方で評価した。[1]
指示が別の可視対象を求める場合でも、評価した政策は原場面に結びついた元の対象へ向かい、拾う傾向が強かった。[1]
線形プローブは指示された対象を復元できた一方、注意解析では指示トークンの寄与が弱いことが示された。[1]
UMAP と shared non-negative matrix factorization により、対象情報は表現内に残るが場面の同一性に強く組織化されていることが示された。[1]

本紙の見方

この論文の新しさは、ロボットが指示文を「理解していない」と単純に言い切るのではなく、指示表現は内部に残っているのに行動選択へつながらない、という分離を実験的に示した点にある。つまり論点は言語認識の有無ではなく、符号化された意図が最終行動を制御できるかどうかである。成功率だけを見れば動作は正しく見えるが、場面に引かれた既定の選択が勝っている可能性を示す構図だ。 本紙の関連記事はないため、過去報道との連続性は置けない。ただし本文の構成からは、典型的な評価法への批判が中心にある。タスク成功率は高くても、指示を変えたときに対象が切り替わるかを見なければ、政策が本当に言語条件付きで動いているかは判断できない。ここで論文が用いた valid target substitutions、任意名詞、無関係文の介入は、いずれも場面を固定したまま意図だけを揺らす設計であり、ロボット政策の評価軸を「達成できたか」から「どの入力が行動を支配したか」へ移している。 業界構造への含意としては、VLA や WAM の学習データが、視覚的に最も妥当な対象を選ぶ癖を強めると、ユーザー指示の差し替えに弱い政策が残りうる点が大きい。注意や表現の次元では指示が埋め込まれていても、それが制御信号にならないなら、学習目的・評価指標・安全確認の3点を分けて見直す必要がある。特に、場面に依存した既定動作が残るかどうか、線形プローブで読める指示情報が最終アクションにどう接続されるか、今後は確認が必要だ。

なぜ重要か

この論文は、ロボットが指示文を内部表現に保持していても、実際の操作では場面に引きずられることがあると示した。公開された事実からは、評価の焦点を成功率だけでなく、指示変更に対する追従性へ広げる必要があると読める。

日本への影響

日本のロボット研究や実機評価でも、タスク達成率のみでなく、指示を変えたときに対象や動作が切り替わるかを確認する設計が重要になるとみられる。特に、視覚的に妥当な対象へ寄る挙動が残るなら、産業用途の安全確認や現場指示の評価で、場面固定の介入試験が有効な検証手段になりうる。