何が起きたか

研究チームは2026年2月4日、arXivにプレプリント「VISTA: Enhancing Visual Conditioning via Track-Following Preference Optimization in Vision-Language-Action Models」を公開した。VISTAは、VLAモデルの視覚条件付けを強化する訓練手法であり、トラッキング模擬タスクでの選好最適化と教師あり微調整中の潜在空間蒸留を組み合わせる。

詳細

VLAモデルはロボット操作タスクで高い性能を示す一方、大規模な事前学習済み視覚言語モデル(VLM)を行動空間に拡張すると、行動予測が現在の視覚状態に弱く依存する「視覚-行動の不整合」が生じることがある。研究では、成功したロールアウトは失敗したものより視覚依存性が強いことを経験的に示した。提案手法は、トラッキング模擬タスクでの選好最適化により行動予測を視覚入力と整合させ、その後、教師あり微調整中に潜在空間蒸留を用いて指示追従タスクへ整合性を転移する。アーキテクチャ変更や追加データ収集を伴わず、離散型OpenVLAで視覚条件付けとタスク性能を改善し、連続型OpenVLA-OFT設定でも一貫した改善が得られた。

Key Facts

研究チームは2026年2月4日にarXivでプレプリント「VISTA: Enhancing Visual Conditioning via Track-Following Preference Optimization in Vision-Language-Action Models」を公開した。[1]
VISTAは、トラッキング模擬タスクでの選好最適化と教師あり微調整中の潜在空間蒸留を用いて、VLAモデルの視覚条件付けを強化する。[1]
研究では、成功したロールアウトは失敗したものより視覚依存性が強いことを経験的に示した。[1]
VISTAはアーキテクチャ変更や追加データ収集を伴わず、離散型OpenVLAで視覚条件付けとタスク性能を改善し、連続型OpenVLA-OFT設定でも一貫した改善が得られた。[1]

なぜ重要か

VISTAは、追加データやアーキテクチャ変更なしでVLAモデルの性能を向上させる手法であり、ロボット操作の基盤モデル開発における訓練戦略の重要性を示す。視覚条件付けの強化がタスク性能に直結するという知見は、今後のVLA研究の方向性に影響を与える可能性がある。