何が起きたか

研究チームは、VLAモデルの汎化性能を高めるフレームワークS2(See Less, Specify More)を提案した。S2は、指示を細分化し、視覚的証拠に予算を設けることで、実機タスクの成功率を大幅に向上させた。

詳細

S2は、元の指示を高レベルの目標として保持しつつ、各軌道をサブタスクレベルの詳細な言語にリラベルする「Specify More」と、視覚的証拠に予算を設ける「See Less」を組み合わせる。これにより、エグゼキューターはタスクに十分な証拠のみに基づいて行動でき、領域やマスクのアノテーションを必要としない。

Key Facts

S2は、VLAモデルの汎化性能を向上させるフレームワークであり、指示を細分化し、視覚的証拠に予算を設ける。[1]
S2は、TX-G2(AgiBot G2互換)とHSRの8つの実機タスクで、平均サブタスク成功率を54.2%から79.0%に向上させた。[1]
S2は、領域やマスクのアノテーションを必要としない。[1]

なぜ重要か

VLAモデルの汎化性能向上は、ロボットが多様な環境で安定して動作するための鍵となる。S2の成果は、ロボットの実用化を加速し、産業現場での適用範囲を広げる可能性がある。