何が起きたか

研究チームは、ロボット制御のための新しい潜在世界アクションモデル「JEPA-WAM」を提案した。JEPA-WAMは、事前学習済みのV-JEPA空間上に構築され、潜在遷移予測と連続行動生成を共有予測器を通じて結合する。現在と未来の観測間のタスク共有の視覚的時間構造を捉える空間構造化された結合現在-未来ターゲットを予測し、密なパッチレベルの対応を保持する。共有予測器により、遷移監視がバックボーンを直接形成し、行動予測のための専用表現が抽出される。この設計は、事前学習済みのVLAポリシーにも適用可能で、元の知覚・行動経路を維持する。実験では、LIBERO-Plusで79.2%を達成し、大規模ロボットポリシー事前学習なしで最高の結果を得た。また、事前学習済みπ0.5への適用では86.3%を達成し、総合最高性能を記録した。さらに、RoboTwin 2.0と実世界の双腕操作実験で、視覚的・空間的シフトに対する強い汎化を示した。

Key Facts

JEPA-WAMは、事前学習済みV-JEPA空間上に構築された潜在世界アクションモデルであり、潜在遷移予測と連続行動生成を共有予測器で結合する。[0]
JEPA-WAMは、現在と未来の観測間のタスク共有の視覚的時間構造を捉える空間構造化された結合現在-未来ターゲットを予測し、密なパッチレベルの対応を保持する。[0]
共有予測器により、遷移監視がバックボーンを直接形成し、行動予測のための専用表現が抽出される。[0]
JEPA-WAMは、事前学習済みのVLAポリシーにも適用可能で、元の知覚・行動経路を維持する。[0]
LIBERO-Plusにおいて、JEPA-WAMは79.2%を達成し、大規模ロボットポリシー事前学習なしで最高の結果を得た。[0]
事前学習済みπ0.5への適用では86.3%を達成し、総合最高性能を記録した。[0]
RoboTwin 2.0と実世界の双腕操作実験で、視覚的・空間的シフトに対する強い汎化を示した。[0]

なぜ重要か

ロボット制御における世界モデルの活用は、ビデオ生成型のアプローチでは導入コストが高いという課題があった。JEPA-WAMは、潜在空間での遷移予測を行動生成と結合することで、将来の生成を回避しつつ、予測表現と行動生成表現の乖離を解消する。これにより、大規模なロボットポリシー事前学習なしで高い性能を達成し、ロボット学習の効率化と実用化に寄与する可能性がある。