何が起きたか
arXivは2026-10-07、論文「Do Vision-Language-Action Models Understand Instructions? A Mechanistic Interpretability Study on Language Grounding」を公開した。論文は、Vision-Language-Actionモデルの行動生成が本当に言語指示に依存しているのかを、π0.5とGR00T N1.7の2モデルで機械論的解釈の手法を使って検証した。LIBEROベンチマークの入力指示を、同義語置換、意味スケーリング、方向情報の破壊、存在しない物体への置換、空文字列の5通りで改変し、出力の変化を比較した。
詳細
論文は、行動生成モジュールの残差ストリームに対してactivation patchingとattribution patchingを適用した。結果として、両モデルとも抽象的な言い換えや存在しない物体への言及には比較的影響を受けにくい一方、空のタスク記述、特に方向を示す言語には強く反応した。 感度が現れる層の位置はモデルごとに異なり、GR00T N1.7では主に初期の周期的なcross-attention層に集中したのに対し、π0.5では最も早い層と一部の後段層に分散した。GR00T N1.7では方向の攪乱が大きな因果効果を生んだ一方で、内部表現の幾何は比較的変化しなかったとしている。
Key Facts
| arXiv掲載日: 2026-10-07 | [1] |
| 論文題目: Do Vision-Language-Action Models Understand Instructions? A Mechanistic Interpretability Study on Language Grounding | [1] |
| 対象モデルは π0.5 と GR00T N1.7 の2件 | [1] |
| 評価に使った改変は同義語置換、意味スケーリング、方向情報の破壊、存在しない物体への置換、空文字列の5通り | [1] |
| GR00T N1.7では感度が主に初期の周期的cross-attention層に、π0.5では最初期層と一部後段層に分散して現れた | [1] |
本紙の見方
この論文の新規性は、VLAモデルが「指示を理解しているか」を、出力精度の比較ではなく残差ストリームへのactivation patchingとattribution patchingで分解している点にある。単なるベンチマーク成績ではなく、どの層で言語が行動生成に効くかを見にいっており、言語接地の議論をモデル内部の因果経路に落とし込んでいる。特に、抽象的な言い換えには鈍感でも、方向を示す語や空の指示には強く反応するという結果は、VLAが「文全体」を均等に読んでいるのではなく、動作に直結する語彙や位置情報に局所的に依存している可能性を示す。 本紙の見方では、ここで重要なのは性能の優劣そのものより、GR00T N1.7とπ0.5で因果効果の現れ方が違う点である。前者は初期の周期的cross-attention層に感度が寄り、後者は最初期層と一部後段層に散る。つまり、同じ「VLAモデル」でも、言語から行動へ橋を架ける内部経路は一様ではない。これは、モデル比較の軸を単純な成功率から、どの層に言語制御が埋め込まれているかへ広げる必要があることを意味する。 また、方向の攪乱で大きな因果効果が出る一方、GR00T N1.7では内部表現の幾何が比較的変わらなかったという記述は、表現の見かけと因果寄与が一致しないことを示唆する。言い換えれば、アクティベーション空間で似て見えても、実際の行動出力への効き方は別問題である。これは安全性評価やデバッグで、表層的な表現類似だけを見て判断することの限界を突く。 未確定の論点としては、これが他のVLAや他のベンチマークでも再現するか、どの程度のサンプル数で安定するか、そして方向語以外の指示カテゴリで同様の層別パターンが出るかが残る。さらに、activation patchingとattribution patchingの一致度がモデル依存である点から、今後はどの解析手法をどのモデル群に適用するかの妥当性検証も焦点になる。
なぜ重要か
論文は、π0.5とGR00T N1.7の両方で、空の指示文や方向言語に対する感度が確認できると示した。これは、VLAモデルの評価が「画像に対する見た目の正しさ」だけでは足りず、指示文のどの部分が行動生成を支配しているかまで確認する必要があることを示す。