何が起きたか
研究チームは、VLAモデルの視覚エンコーダが、汎用Vision Transformerで報告されている注意アーティファクトを示すことを発見した。さらに、これらのアーティファクトは、ポストトレーニングで獲得される空間知覚能力(物体位置、奥行き順序、局所形状)と密接に関連していることを明らかにした。限られたグローバルトークン容量により、タスク関連情報の一部が低情報パッチトークンに漏れ出す。そこで提案されたAtVLAは、視覚エンコーダに学習可能なレジスタトークンを挿入し、エンボディッドデータと元の行動目的のみでエンドツーエンドに訓練する。これにより、レジスタトークンは空間情報の専用キャリアとなり、残りのパッチトークンはクリーンで空間的に忠実な注意分布を取り戻す。さらに、低解像度観察で失われた幾何学的詳細を補うため、不確実性ゲート付き局所リファインメントを導入。行動エキスパートが複数の行動チャンクをサンプリングし、その不一致から不確実性を推定し、不確実な予測に対してのみ、行動条件付き注意ロールアウトでタスク関連領域を特定し、高解像度で再符号化して洗練された行動生成に利用する。評価では、LIBERO、SimplerEnv、単一視点の実世界ベンチマークで性能を確認。LIBERO成功率は94.2%から98.4%に、実世界成功率は46.5%から69.0%に向上した。クロッピングは再計画ステップの約30%で発生し、代表的なデプロイ設定ではベースモデルの総計算量の1.4〜1.6倍に抑えられた。
Key Facts
| VLAモデルの視覚エンコーダは、汎用Vision Transformerで報告されている注意アーティファクトを示す。 | [0] |
| 注意アーティファクトは、ポストトレーニングで獲得される空間知覚能力(物体位置、奥行き順序、局所形状)と関連する。 | [0] |
| AtVLAは視覚エンコーダに学習可能なレジスタトークンを挿入し、エンボディッドデータと元の行動目的で訓練する。 | [0] |
| AtVLAは不確実性ゲート付き局所リファインメントを導入し、不確実な予測に対してのみ高解像度で再符号化する。 | [0] |
| LIBERO成功率は94.2%から98.4%に向上した。 | [0] |
| 実世界成功率は46.5%から69.0%に向上した。 | [0] |
| クロッピングは再計画ステップの約30%で発生し、総計算量はベースモデルの1.4〜1.6倍。 | [0] |
なぜ重要か
ロボット操作におけるVLAモデルの実用性は、空間的に正確な操作ができるかどうかにかかっている。AtVLAは、注意アーティファクトの修正と不確実性に基づく局所リファインメントを組み合わせることで、計算コストの増加を抑えつつ、シミュレーションと実世界の両方で成功率を大幅に向上させた。これは、VLAモデルの空間知覚能力を強化する新しい手法であり、今後のロボット学習研究に影響を与える可能性がある。