何が起きたか

2026年7月15日、arXivに「Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment」と題する論文が公開された。提案手法Anchor-Alignは、行動クローニングによる微調整が事前学習表現を上書きする問題に対処し、実機xArm7で成功率を28%から54%、37%から60%に改善したとしている。

詳細

Anchor-Alignは、行動クローニングに2つの目的を追加する。1つはVision-Language Anchoringで、凍結したVLMコピーから層ごとの表現を蒸留して表現のドリフトを防ぐ。もう1つはLanguage-Action Alignmentで、各行動目標を離散的な運動方向ラベルに変換し、同じロボット観測に対して言語予測と行動予測を同時に学習する。シミュレーションでは、LIBERO-PRO、LIBERO-Plus、CALVINにおいて、OOD摂動、知覚ロバスト性、長 horizon 制御で一貫した改善を示した。

Key Facts

Anchor-Alignは、行動クローニングにVision-Language AnchoringとLanguage-Action Alignmentの2つの目的を追加する手法である。[1]
実機xArm7で、2つのVLAアーキテクチャにおいて成功率が28%から54%、37%から60%に向上した。[1]
シミュレーションでは、LIBERO-PRO、LIBERO-Plus、CALVINでOOD摂動、知覚ロバスト性、長 horizon 制御の改善を示した。[1]
論文は2026年7月15日にarXivで公開された。[1]

本紙の見方

本論文の新規性は、VLA方策の微調整における表現劣化を、凍結VLMからの蒸留と行動ラベルの言語化という2つの補助目的で直接的に防ぐ点にある。行動クローニングが事前学習表現を上書きする問題は広く知られていたが、既存の対処法であるウェブ画像テキストデータとの共学習は、言語損失と行動損失を別々の観測に適用するため、言語と行動の整合性が取れないという欠点があった。Anchor-Alignは、同じ観測に対して言語と行動を同時に学習することでこの不整合を解消し、表現の保持と行動学習の両立を図る。 本紙の過去報道との接続はないが、VLA分野の研究動向として、事前学習の活用とロボット固有の適応のバランスが重要な論点であることは共通する。本手法は、凍結モデルからの蒸留という知識保存のアプローチを取っており、破壊的忘却を防ぐ手法として位置づけられる。 業界構造への含意としては、VLA方策の汎化性能向上が、ロボットの実環境での適用範囲を広げる可能性がある。特に、OOD摂動や知覚ロバスト性の改善は、実世界の多様な状況への適応に寄与する。また、言語と行動の整合性を高めることで、ユーザーが自然言語でロボットを指示する際の精度向上が期待される。 未確定の論点としては、実機での評価がxArm7に限定されており、他のロボットプラットフォームでの有効性が不明である点が挙げられる。また、シミュレーションでの改善が実機でも再現されるか、特に長 horizon タスクでの性能が焦点になる。さらに、蒸留に用いる凍結VLMの選択や、計算コストの増加が実用上の課題となる可能性がある。

なぜ重要か

VLA方策の汎化性能は、ロボットが実環境で多様なタスクを遂行する上で重要であり、本手法はその性能向上に寄与する可能性がある。特に、言語と行動の整合性を高めることで、自然言語によるロボット制御の実用化が進むとみられる。