何が起きたか

研究者らは、小型VLAモデルの操作能力を高めるフレームワークXS-VLAを発表した。XS-VLAは、粗い空間蒸留と潜在フローマッチングを導入し、LIBEROベンチマークで平均成功率を82.8%から90.3%に、実世界の3タスクで21.7%から65.0%に改善した。

詳細

XS-VLAは、タスク関連オブジェクトの粗い画像平面位置ラベルを教師モデル(Qwen3-VL-4B)から生成し、空間語彙に量子化してSmolVLM2-0.25Bバックボーンに蒸留する。行動生成には、CVAEスタイルの潜在変数とフローベースのポリシー学習を組み合わせた潜在フローマッチングを用いる。実世界実験では、単腕配置、精密両腕スタッキング、長期的順序協調の3タスクを設計し、平均成功率を21.7%から65.0%に改善した。

Key Facts

XS-VLAは、小型VLAモデルの空間的接地と行動生成を強化するフレームワークである。[1]
LIBEROベンチマークで、XS-VLAは平均成功率を82.8%から90.3%に改善した。[1]
実世界実験では、3タスクの平均成功率を21.7%から65.0%に改善した。[1]
空間的接地には、Qwen3-VL-4Bによる教師蒸留とSmolVLM2-0.25Bバックボーンを使用する。[1]
行動生成には、CVAEスタイルの潜在変数とフローベースのポリシー学習を組み合わせる。[1]

なぜ重要か

小型VLAモデルの性能向上は、ロボット制御のリアルタイム性とコスト効率を両立させる可能性を秘めており、産業用ロボットやサービスロボットへの応用が期待される。今回の成果は、モデル規模と性能のトレードオフを緩和する一つの方法を示しており、今後の小型VLAモデルの研究開発に影響を与えるとみられる。