何が起きたか
研究チームは、VLAモデルの汎化性能を高めるフレームワークS2(See Less, Specify More)を提案した。S2は、指示を細分化し、視覚的証拠に予算を設けることで、実機タスクの成功率を大幅に向上させた。
詳細
S2は、元の指示を高レベルの目標として保持しつつ、各軌道をサブタスクレベルの詳細な言語にリラベルする「Specify More」と、視覚的証拠に予算を設ける「See Less」を組み合わせる。これにより、エグゼキューターはタスクに十分な証拠のみに基づいて行動でき、領域やマスクのアノテーションを必要としない。
Key Facts
| S2は、VLAモデルの汎化性能を向上させるフレームワークであり、指示を細分化し、視覚的証拠に予算を設ける。 | [1] |
| S2は、TX-G2(AgiBot G2互換)とHSRの8つの実機タスクで、平均サブタスク成功率を54.2%から79.0%に向上させた。 | [1] |
| S2は、領域やマスクのアノテーションを必要としない。 | [1] |
なぜ重要か
VLAモデルの汎化性能向上は、ロボットが多様な環境で安定して動作するための鍵となる。S2の成果は、ロボットの実用化を加速し、産業現場での適用範囲を広げる可能性がある。