何が起きたか

arXivに2026年7月11日付で掲載された論文「Adaptive Compute in Latent World Models: When Depth Helps, Hurts, or Doesn't Matter」は、潜在世界モデルにおける適応計算の効果を検証した。研究チームは、DeepMind Controlの9つのタスクを用いて、単一ステップ(K=1)と複数ステップ(K=4)のトレーニングを各8シードで実施し、浅い出口と深い出口のロールアウト誤差の比である浅さペナルティρを測定した。その結果、深さが性能向上に寄与するタスク(6/9、ρ最大8倍)、逆に悪影響を与えるタスク(2/9、ρ最小0.87倍)、および影響がほぼないタスクに分類された。

詳細

研究では、深さが逆効果となる「反転」現象がトレーニングによって生じることが示された。最初のロールアウトステップでのみ早期出口を監視することで反転が消失し(Δ=+0.28、n=8、分布が重ならない)、これは「ルーティングのジレンマ」と表現されている。つまり、出口をルーティング可能にするためのステップごとの深い監視が、フルスタックを超えるロールアウトを訓練することになるという。 反転はトランスフォーマー予測子でも再現されたが、その発現は設定に依存し、メトリック空間、ホライズン、エンコーダー、バックボーン、特にトレーニングデータに強く影響された。再トレーニングした2つのタスクでは、有能なポリシーのデータが反転と本質的なトレードオフの両方を除去し、損失は不変だった。CEMプランナーでは、ρがプランニングの深さの恩恵を予測した。すべての閾値とゲートは対応する計算の前にコミットされ、動機付け仮説に対する事前登録されたネガティブ結果も含まれている。

Key Facts

論文はarXivに2026年7月11日付で掲載された(ID: 2607.10203v3)[1]
研究はDeepMind Controlの9タスクを使用し、各8シードで実施[1]
浅さペナルティρは、浅い出口のロールアウト誤差と深い出口のロールアウト誤差の比として定義[1]
深さが性能向上に寄与するタスクは6/9で、ρは最大8倍[1]
深さが逆効果となるタスクは2/9で、ρは最小0.87倍[1]
最初のロールアウトステップでのみ早期出口を監視すると反転が消失(Δ=+0.28、n=8)[1]
反転はトランスフォーマー予測子でも再現されたが、設定に依存[1]
再トレーニングした2タスクでは、有能なポリシーのデータが反転とトレードオフを除去[1]
CEMプランナーでは、ρがプランニングの深さの恩恵を予測[1]

なぜ重要か

この研究は、世界モデルにおける適応計算の有効性がタスクの特性ではなく動作設定に依存することを示し、モデル設計の指針に影響を与える。事前登録された仮説検証により、深層予測の利点と欠点を予測可能なメカニズムが存在することが示唆される。