何が起きたか
arXivで2026-10-07に公開された論文「Rephrase Before You Act: Characterizing and Mitigating Language Sensitivity in Vision-Language-Action Models」は、vision-language-action models(VLA)が指示文の表現に強く敏感で、1語の違いで成功率が大きく変わると報告した。論文は、LIBERO環境で「switch on the stove」が100%成功する一方、「switch on the hot plate」は2%にとどまる例を示している。
詳細
論文は、統計的に検定した単一編集の変動と oracle phrase search により、言い回しだけで分布内タスクと分布外タスクの21ポイント差がほぼ埋まると述べた。さらに、学習済みポリシーを変更せず、訓練タスクの複数の言い回しを採点して大規模言語モデルに10〜20個の言い換えルールへ要約させ、推論時に受け取った指示を1回だけ書き換える手法を提案した。
Key Facts
| 論文名は「Rephrase Before You Act: Characterizing and Mitigating Language Sensitivity in Vision-Language-Action Models」である。 | [1] |
| 掲載日は2026-10-07である。 | [1] |
| VLAは指示の言い回しに強く敏感だと論文は報告している。 | [1] |
| LIBEROの例では「switch on the stove」が100%成功し、「switch on the hot plate」は2%だった。 | [1] |
| 提案手法は再学習を必要とせず、12の保留タスクで相対16〜27%の改善を示した。 | [1] |
本紙の見方
この論文の新規性は、VLAの性能差を単なるノイズではなく、言い回しに起因する系統的な脆弱性として切り出し、その場での書き換えで緩和しようとした点にある。重要なのは、モデル本体を再学習しないまま、入力文だけを整形して性能差を縮める設計である。一方で、問題設定自体は既存のVLAを前提にしており、モデル構造の刷新ではなく運用層での補正に近い。論文中の21ポイント差や、再学習後でも最大61ポイントの揺れが残るという記述は、言語頑健性が学習済みモデルの性質として十分に解消されていないことを示す材料である。 本紙の関連記事はないため、過去報道との接続は置かない。公開情報だけを見ると、ここで問われているのはロボットの知覚精度そのものではなく、自然言語インターフェースが実行段階でどの程度安定して動作するかである。つまり、入力文の揺れがそのままロボット動作の揺れに変換されるなら、学習データを増やすだけではなく、指示生成・整形の層を別途持つ必要が出てくるとみられる。これは、VLAを「見る・理解する・動く」の一体モデルとして扱うだけでは足りず、言語側の前処理を実装上の制御点として組み込むべきだという示唆でもある。 業界構造への含意としては、評価軸が単純な平均成功率から、表現ゆらぎに対する最悪ケースや分布外タスクでの安定性へ移る可能性がある。論文は adversarial、VLM-generated、human-generated の言い回しに対して改善を示しており、実運用では人手指示だけでなく、別のモデルが生成した文や対話的な曖昧表現も対象になることが分かる。したがって、今後は学習済みポリシーの性能だけでなく、入力の正規化規則、タスクごとの言い換えルール、そしてそれが未知タスクにどこまで転用できるかが焦点になる。 未確定の論点は、まずこの方法がLIBERO以外の実機環境や長い指示文でも同じ改善幅を保てるかである。次に、10〜20個のルールで十分とされる条件が何か、どの種類の表現差を取り逃がすのか、そして推論時の1回の書き換えで安全性や意図の保持が損なわれないかを確認する必要がある。あわせて、12の保留タスクでの改善が、タスク群の構成にどの程度依存するかも検証対象になる。
なぜ重要か
論文が示したのは、VLAの失敗要因がロボット本体の制御誤差だけでなく、指示文の言い回しにある場合があるという点である。モデルを再学習せずに入力文の書き換えで12タスクの性能を押し上げたとするなら、導入側は学習コストよりも、指示の標準化と運用設計を重視する必要がある。
日本への影響
日本のロボット開発では、音声・テキスト指示を介したVLA型の操作設計を採る場合、指示の言い回しを前処理で統一する層が実装上の論点になるとみられる。とくに現場向けの自然言語インターフェースを使う場合、モデル性能だけでなく、運用ルールとしての言い換え規則を持てるかが差分になりうる。