何が起きたか

2026年5月27日、arXivにプレプリント『ProgVLA: Progress-Aware Robot Manipulation Skill Learning』が公開された。同論文は、0.1BパラメータのProgVLAモデルが、2つの確立されたマルチタスクロボット操作ベンチマークにおいて、長距離・高難度タスクで大規模な事前学習ベースラインを上回る成功率を達成したと報告している。

詳細

ProgVLAは、長いマルチモーダルシーケンスを効率的に処理するため、2段階のPerceiverリサンプリング方式を備えたマルチモーダルエンコーダを統合し、可変長の視覚・言語・固有受容ストリームを固定サイズの制御用コンテキストトークンに圧縮する。また、オフライン強化学習(RL)の目的で訓練された補助的な進行ヘッドを追加し、正規化された残りホライズン目標に対するクリティックを学習する。これにより、ポリシーはタスク進行の内部推定を得て、アドバンテージ・成功率重み付きフローマッチング模倣学習を可能にする。アブレーションでは、学習されたコンテキストリサンプラーとタスク適応型視覚ファインチューニングが最大の貢献要因であり、進行認識訓練は長距離・多物体タスクに集中した一貫した追加利得をもたらすとしている。

Key Facts

ProgVLAは、計算・メモリ予算が厳しい環境での信頼性の高いロボット操作を目的としたコンパクトなVLAモデルである。[1]
ProgVLAは、2段階のPerceiverリサンプリング方式を備えたマルチモーダルエンコーダを統合し、可変長の視覚・言語・固有受容ストリームを固定サイズの制御用コンテキストトークンに圧縮する。[1]
ProgVLAは、オフラインRLの目的で訓練された補助的な進行ヘッドを追加し、正規化された残りホライズン目標に対するクリティックを学習する。[1]
0.1BパラメータのProgVLAモデルは、2つの確立されたマルチタスクロボット操作ベンチマークで、長距離・高難度タスクにおいて、より大きな事前学習ベースラインと競合または上回る成功率を達成した。[1]
アブレーションでは、学習されたコンテキストリサンプラーとタスク適応型視覚ファインチューニングが最大の貢献要因であり、進行認識訓練は長距離・多物体タスクに集中した一貫した追加利得をもたらす。[1]

なぜ重要か

ProgVLAは、リソース制約下でも高性能なロボット操作を実現する可能性を示しており、ロボットの実用化における計算コストの壁を低減する一歩となる。長距離タスクでの性能向上は、実世界の複雑な操作への応用を後押しし、VLAモデルの設計指針に影響を与えるとみられる。