何が起きたか
2026年2月28日にarXivで公開された論文「LangGap: Diagnosing and Closing the Language Gap in Vision-Language-Action Models」は、標準ベンチマークで95%以上の成功率を達成するVLAモデルが、系統的実験により言語指示を無視していることを発見した。論文は、テーブルトップのレイアウトを固定したまま指示の意味を変化させる4次元の意味摂動法に基づくベンチマーク「LangGap」を構築し、π0.5の言語理解欠陥を明らかにした。
詳細
LangGapベンチマークは、既存のLIBEROがレイアウトごとに1タスクしか割り当てず、利用可能なオブジェクトと目標位置を十分に活用していないのに対し、同一レイアウト下でpick-and-placeタスクを完全に多様化し、モデルに言語を真に理解させることを強制する。実験では、対象を絞ったデータ拡張により言語ギャップを部分的に閉じることができ、成功率は単一タスク学習で0%から90%、多タスク学習で0%から28%に改善した。しかし、拡張タスクの意味的多様性が増すにつれ、モデルの学習能力は深刻に不足し、訓練済みタスクでも性能が低いことが示された。
Key Facts
| VLAモデルは標準ベンチマークで95%以上の成功率を達成するが、系統的実験により言語指示を無視していることが判明した。 | [1] |
| LangGapベンチマークは、テーブルトップのレイアウトを固定したまま指示の意味を変化させる4次元の意味摂動法に基づく。 | [1] |
| LangGapは、同一レイアウト下でpick-and-placeタスクを完全に多様化し、モデルに言語を真に理解させることを強制する。 | [1] |
| データ拡張により、成功率は単一タスク学習で0%から90%、多タスク学習で0%から28%に改善した。 | [1] |
| 拡張タスクの意味的多様性が増すにつれ、モデルの学習能力は深刻に不足し、訓練済みタスクでも性能が低い。 | [1] |
本紙の見方
今回の論文は、VLAモデルの評価方法そのものに疑問を投げかける。標準ベンチマークで95%以上の成功率を達成しながら、言語指示を無視しているという発見は、既存の評価指標が言語理解を適切に測定できていないことを示唆する。LangGapは、レイアウトを固定して指示の意味だけを変えることで、モデルが視覚的な手がかりに依存し、言語を無視することを暴いた。これは、ロボットが実世界で多様な指示を理解するためには、より厳格な評価が必要であることを意味する。 本紙の過去報道では、TuringがVLAモデルによる実道自動運転を達成し、RoboDynaやEkko55がVLAモデルを公開している。これらのモデルは、特定のタスクや環境で高い性能を示しているが、LangGapの指摘は、それらのモデルが言語指示をどの程度理解しているかについて再検討を促す。特に、Turingのモデルは約20億パラメータと大規模であり、RoboDynaのモデルは4,050エピソードで学習されているが、言語指示の多様性に対する頑健性は不明である。 業界構造への含意として、VLAモデルの開発競争は、単にベンチマークの成功率を上げるだけでなく、言語理解の質を評価する新たな基準が必要になる。LangGapのようなベンチマークが普及すれば、モデルの言語理解能力が差別化要因となり、データセットの構築やデータ拡張の方法にも影響を与えるだろう。特に、多タスク学習での成功率が28%にとどまったことは、現在のモデルアーキテクチャや学習手法の限界を示しており、今後の研究の焦点となる。 未確定の論点として、LangGapの実験で使用されたモデルはπ0.5のみであり、他のVLAモデルでの検証が必要である。また、データ拡張の具体的な方法や、多タスク学習での成功率を向上させるためのアプローチは論文からは明らかでない。さらに、LangGapが実世界のロボットタスクにどの程度適用できるかも今後の課題である。
なぜ重要か
VLAモデルが言語指示を無視するという発見は、ロボットの実用化における信頼性に直結する。ユーザーが自然言語で指示を出しても、モデルがそれを無視して視覚情報だけで行動するなら、実世界での応用は危険である。LangGapは、この問題を診断し、改善の方向性を示す重要な一歩であり、今後のVLAモデル開発の評価基準を変える可能性がある。