何が起きたか

研究チームは、ロボット操作における汎用ポリシーの性能向上を目的として、JEPA-WAMを提案した。JEPA-WAMは、MotusベースのWorld Action Model (WAM)に、目標条件付きのJoint-Embedding Predictive Architecture (JEPA)予測器であるStage-JEPAを追加したものである。Stage-JEPAは、現在の観測とタスク指示から、凍結したV-JEPA2エンコーダを用いて現在状態の表現を抽出し、次の推論段階の潜在目標を予測する。これにより、短期的な物理的未来と段階レベルの意味的未来の2つの補完的な未来を区別する。実験では、クリーンおよびランダム化環境のRoboTwin 2.0の50タスクで、成功率90.25%を達成し、最強のベースラインと比較して成功ロールアウトの平均実行ステップ数を5.97%削減した。

Key Facts

JEPA-WAMは、MotusベースのWorld Action Model (WAM)にStage-JEPAを追加したものである。[0]
Stage-JEPAは、凍結したV-JEPA2エンコーダを使用して現在状態の表現を抽出し、次の推論段階の潜在目標を予測する。[0]
JEPA-WAMは、RoboTwin 2.0の50タスクで成功率90.25%を達成した。[0]
JEPA-WAMは、最強のベースラインと比較して、成功ロールアウトの平均実行ステップ数を5.97%削減した。[0]

なぜ重要か

ロボット操作の汎用ポリシーでは、将来を固定の短いビデオアクションチャンクとして表現する手法が一般的だが、JEPA-WAMは段階レベルの意味的未来を予測することで、タスクの進行を明示的に捉える。これにより、複雑なタスクでの成功率向上と実行効率の改善が示され、ロボット操作のポリシー設計に新たな方向性を提供する可能性がある。