何が起きたか

arXivは2026-09-26、「Adaptive Latent Capacity for World Models」を公開した。論文は、joint-embedding predictive architecture(JEPA)に基づくワールドモデルAdaptive LeWorldModel(ALeWM)と、正則化手法MixSIGRegを提案している。ALeWMは、広い潜在表現の中でも予測に重要な情報を短い先頭部分に集約するよう学習させる設計である。

詳細

ALeWMでは、系列条件付きでプレフィックス長の分布を学習し、入力の一部プレフィックスから次の埋め込み全体を推定する。論文は、通常の反崩壊目的が潜在座標のばらつきは促しても、予測上の重要度で並べ替えることはしないため、MixSIGRegを導入したとしている。MixSIGRegは、マスクされた埋め込みを、先頭ブロックがガウス分布で活動し、残りがゼロである事前重み付き混合と照合する形で正則化する。

Key Facts

arXivで「Adaptive Latent Capacity for World Models」が2026-09-26に公開された。[1]
論文は、JEPAに基づくワールドモデルAdaptive LeWorldModel(ALeWM)を提案している。[1]
ALeWMは、広い潜在表現の先頭プレフィックスに予測情報を集約する設計である。[1]
論文は正則化手法MixSIGRegを導入している。[1]
実験では、調整済みの固定幅LeWMより高い平均成功率を示したとしている。[1]

本紙の見方

この論文の新しさは、ワールドモデルの潜在表現を単に圧縮するのではなく、予測に効く情報を先頭ブロックへ並べるよう学習させる点にある。JEPA系の表現学習は広い潜在空間を使える一方で、どの座標に何を置くかは自動的には整理されにくい。ALeWMは、プレフィックス長を系列条件付きで扱い、MixSIGRegで先頭側の座標に高い分散、後段に低い分散を与える混合分布を使うことで、この並び順そのものを学習対象にした構成だと読める。 本紙の観点では、これは「表現を学ぶモデル」から「表現の配置まで制御するモデル」への一歩である。予測やリカーシブな計画に使う情報を前方へ寄せる設計は、モデル内部のどの部分をどの計算に使うかを分けやすくする。もっとも、論文が示しているのは制御された力学系と目標条件付き視覚制御での結果であり、実環境で同じ挙動がどこまで保たれるかは別問題である。固定幅LeWMとの比較で成功率が改善した一方、平均の計画容量は低いとしているため、性能向上と内部容量の使い方のトレードオフが焦点になる。 業界構造への含意としては、世界モデルの評価軸が「潜在表現の有無」から「予測に必要な情報をどこへ配置したか」に移る可能性がある。これは、計画制御、視覚ベースの意思決定、長い予測鎖を扱う系で、単なる埋め込みの大きさよりも、座標順序やマスクの設計が重要になることを示す。今後確認すべきなのは、固定幅LeWMとの差がどの条件で維持されるか、プレフィックス長の分布がデータやタスクごとにどう変わるか、そしてMixSIGRegが計算コストや学習安定性にどの程度影響するかである。

なぜ重要か

論文は、ALeWMが制御された力学系と目標条件付き視覚制御で、調整済み固定幅LeWMより高い平均成功率を示したとしている。予測情報を先頭プレフィックスへ集約する設計は、ワールドモデルの内部表現を計画に使いやすくする可能性がある。