何が起きたか

2026年8月17日にarXivにプレプリント(識別子: 2608.16287v1)が公開された。論文は、関節埋め込み予測(JEPA)に基づく世界モデルにおけるプランニング手法を改善するSCALE(State-Calibrated Latent Embeddings)を提案している。SCALEは、エンドツーエンドで学習されるLeWorldModel(LeWM)の表現に、DINO-WMが持つ有利な幾何学的特性を導入する。実験では、5つのタスク、3つのプランニングソルバー、5つの計算予算にわたり、SCALEはすべてのタスク・ソルバー平均でLeWMを上回った。

詳細

JEPAベースの世界モデルは、表現空間上で定義されたコストを用いて、予測された終端埋め込みを目標埋め込みと比較することでプランニングを行う。非崩壊表現を得るための2つの主要な戦略として、DINO-WMのように事前学習済みの特徴空間を継承する方法と、LeWorldModel(LeWM)のようにSIGRegを用いた反崩壊正則化でエンドツーエンドに埋め込みを学習する方法がある。これらの戦略はタスクによって相補的な強みを示す。両モデルの完全な埋め込みからタスク関連の状態をデコードできるが、DINO-WMの主要な主成分は通常、LeWMよりも多くの状態情報を保持する。ユークリッドプランニングコストは高分散方向に支配されるため、この違いは状態が候補選択に与える影響の強さに影響する。 SCALEは、サンプリングされたペアの潜在距離と、標準化されたタスク関連状態空間での距離を相関させることで、この特性を誘導する。LeWMの学習済みエンコーダを置き換えることはない。潜在から状態への回帰制御は、SCALEの完全埋め込みデコーダビリティと同等以上であるが、潜在・状態間の距離アライメントはほぼ変化せず、プランニングの改善は一貫性に欠ける。SCALEは、単一の軽量なトレーニング時正則化子を追加するだけで、プランニング時のオーバーヘッドはない。

Key Facts

SCALEは、JEPAプランニングのための状態校正潜在埋め込み(State-Calibrated Latent Embeddings)を提案する手法である。[1]
SCALEは、エンドツーエンドで学習されるLeWorldModel(LeWM)の表現に、DINO-WMが持つ有利な幾何学的特性を導入する。[1]
SCALEは、サンプリングされたペアの潜在距離と、標準化されたタスク関連状態空間での距離を相関させることで、この特性を誘導する。[1]
SCALEは、LeWMの学習済みエンコーダを置き換えることはない。[1]
5つのタスク、3つのプランニングソルバー、5つの計算予算において、SCALEはすべてのタスク・ソルバー平均でLeWMを上回った。[1]
潜在から状態への回帰制御は、SCALEの完全埋め込みデコーダビリティと同等以上であるが、潜在・状態間の距離アライメントはほぼ変化せず、プランニングの改善は一貫性に欠ける。[1]
SCALEは、単一の軽量なトレーニング時正則化子を追加するだけで、プランニング時のオーバーヘッドはない。[1]
DINO-WMの主要な主成分は通常、LeWMよりも多くの状態情報を保持する。[1]
ユークリッドプランニングコストは高分散方向に支配されるため、状態が候補選択に与える影響の強さに差が生じる。[1]

なぜ重要か

この研究は、JEPAベースの世界モデルにおけるプランニング性能が、タスク関連情報の存在だけでなく、その情報がプランナーが消費する幾何学を形成するかどうかに依存することを示している。SCALEは、エンドツーエンド学習の利点を保ちながら、幾何学的特性を改善する軽量な手法を提供し、ロボットや自律システムのプランニング性能向上に寄与する可能性がある。