何が起きたか

研究チームは2026年2月4日、arXivにプレプリント「SCALE: Self-uncertainty Conditioned Adaptive Looking and Execution for Vision-Language-Action Models」を公開した。SCALEは、VLAモデルの推論時に自己不確実性を利用して視覚認識と行動生成を同時に調整する手法で、追加学習や検証器を不要とし、単一のフォワードパスのみで動作する。実験では、シミュレーションと実世界のベンチマークで既存のVLAモデルを改善し、既存のテスト時スケーリング手法を上回ったと報告している。

詳細

SCALEは、Active Inference理論における不確実性駆動の探索に着想を得た推論戦略である。高不確実性時には視覚認識と行動の両方で探索を広げ、低不確実性時には活用に集中することで、様々な条件に適応的に実行する。追加のトレーニングや検証器を必要とせず、単一のフォワードパスのみで効率的に動作する点が特徴。実験では、シミュレーションと実世界のベンチマークで、最先端のVLAモデルを改善し、既存のテスト時スケーリング手法を上回る性能を示したとしている。

Key Facts

SCALEは、VLAモデルの推論時に自己不確実性に基づいて視覚認識と行動生成を同時に調整する手法である。[1]
SCALEは追加のトレーニングや検証器を必要とせず、単一のフォワードパスのみで動作する。[1]
SCALEはActive Inference理論の不確実性駆動探索に着想を得ている。[1]
実験では、シミュレーションと実世界のベンチマークで、SCALEは最先端のVLAモデルを改善し、既存のテスト時スケーリング手法を上回ったと報告されている。[1]

なぜ重要か

SCALEは、追加学習や検証器を必要とせず単一のフォワードパスで動作するため、VLAモデルの実用性を高める可能性がある。特に、計算資源が限られるロボットへの展開において、推論時の効率性と適応性の両立は重要な進展であり、今後のロボット制御の基盤技術として注目される。