何が起きたか

研究チームは、視覚言語行動(VLA)ポリシーが模倣するロボットコマンドが3D世界をどう変えるかを明示的に学習する手法を提案した。従来の行動ラベルはコマンドのみを示し、世界への影響を欠いていた。Track4Actionは、凍結された世界中心3Dトラッカーから、デモクリップのKフレーム遷移で実現された遷移を蒸留する。訓練時、Track4Worldがクリップをプールされたトラッカー特徴にエンコードし、学習可能なトラッククエリが現在のVLA隠れ状態からこの特徴を推論し、共有空間でマッチングし、フロー整合行動ヘッドを特徴ワイズゲートで条件付ける。トラッカー特徴はアライメント目標のみを定義するため、展開時にはクリップもトラッカーも不要。結果、ゼロショットLIBERO-Plusで82.3%(アライメントなし変種比+7.6ポイント、LaMP比+3.0ポイント)、RoboTwin 2.0のクリーン/ランダム分割で80.44%/81.48%、実機バイマニュアル4タスクで平均67.5%(アライメントなし変種比+25.0ポイント)を達成した。

Key Facts

Track4Actionは、凍結された世界中心3Dトラッカーから実現された遷移を現在の観測VLAポリシーに蒸留するフレームワークである。[0]
Track4ActionはゼロショットLIBERO-Plusで82.3%を達成し、アライメントなし変種を7.6ポイント、LaMPを3.0ポイント上回った。[0]
Track4ActionはRoboTwin 2.0のクリーン分割で80.44%、ランダム分割で81.48%を達成した。[0]
Track4Actionは実機バイマニュアル4タスクで平均67.5%の成功率を記録し、アライメントなし変種より25.0ポイント高い。[0]
展開時にはクリップもトラッカーも使用されない。[0]

なぜ重要か

この研究は、VLAポリシーが行動の世界への影響を理解するための教師信号として、3Dトラッカー特徴が有効であることを示した。トラッカー不要の展開を可能にしつつ、シミュレーションと実機の両方で性能を大幅に向上させた点で、ロボット操作の基盤モデル開発に重要な進展をもたらす。