何が起きたか
arXivは2026-10-07付で、「Sparse Planning in Visual World Models via Cost Gradients」と題する論文を公開した。論文は、視覚世界モデルにおける大きな空間トークングリッドの反復処理を減らすため、訓練不要の目標条件付き選択器「COSTGRAD」を提案している。計画コストの各入力トークンに対する勾配ノルムでトークンを順位付けし、予測ではなく制御目的に効くトークンを残す設計である。
詳細
論文では、AdaLN条件付き予測器で50%疎化を行った場合、COSTGRADは4本中3本の連続制御ベンチマークで全トークン計画と同等以上の性能を示し、環境あたりの計画ステップでは実測で2.6倍のウォールクロック高速化を得た。さらに、トークン疎化とCEM探索の削減を組み合わせると、全体の高速化は約5倍に達しつつ、なお全トークンのベースラインを上回ったという。 一方で、論文はアーキテクチャ依存の失敗モードも示した。AdaLNとconcatを同条件で比較すると、concatは全トークン性能を同程度に保ったが、COSTGRAD単体ではランダム選択に対する優位を失った。著者らは、この差がaction-pathway driftと整合的だとしている。
Key Facts
| arXivに「Sparse Planning in Visual World Models via Cost Gradients」が掲載された。 | [1] |
| COSTGRADは、各入力トークンに対する計画コストの勾配ノルムで空間トークンを順位付けする、訓練不要の目標条件付き選択器である。 | [1] |
| AdaLN条件付き予測器で50%疎化した場合、4本中3本の連続制御ベンチマークで全トークン計画に匹敵または上回った。 | [1] |
| 環境あたりの計画ステップでは、実測で2.6倍のウォールクロック高速化を得た。 | [1] |
| トークン疎化とCEM探索の削減を組み合わせると、全体の高速化は約5倍になった。 | [1] |
本紙の見方
この論文の新しさは、世界モデルの計画を「どのトークンを捨てるか」という選択問題として定式化し、その基準を予測誤差ではなく制御目的に直結する勾配ノルムに置いた点にある。単なる軽量化ではなく、計画コストに対する寄与で空間トークンを選ぶため、計算量削減と性能維持を同時に狙う設計である。AdaLN条件付き予測器で50%疎化しながら3/4のベンチマークで全トークン計画に並んだことは、疎化が必ずしも精度低下に直結しないことを示す材料だが、同時にアーキテクチャ次第で結果が変わることも明らかにした。 本紙の関連記事はないため、ここではこの論文単体の含意を読む必要がある。重要なのは、COSTGRADが「入力側の削減」と「探索側の削減」を分けて扱っている点である。前者は空間トークンの選別、後者はCEM探索の縮減であり、約5倍の高速化は両者の積み上げで生じている。つまり、世界モデルの高速化は単一の圧縮手法ではなく、表現段階と探索段階の両方で計算を削る構造として設計できる可能性がある。ただし、concatではCOSTGRADの優位が失われたため、疎化のルールがアーキテクチャに移植可能かどうかが次の論点になる。 業界構造への含意としては、視覚世界モデルを用いる連続制御系で、計画時の計算負荷がどの層で発生しているかを再点検する契機になる。トークンを減らすだけでは不十分で、どの表現形式が勾配ベース選択と整合するかが性能差を左右することが示されたためである。したがって、今後は疎化率そのものよりも、AdaLNとconcatのような結合様式、CEM探索との組み合わせ、そしてaction-pathway driftのような挙動差をどう制御するかが焦点になる。未確定論点としては、他のタスク群や別系統の世界モデルでも同じ速度・性能の両立が成り立つか、また疎化率を50%以外に振った場合の限界がどこにあるかが残る。
なぜ重要か
この手法は、視覚世界モデルの計画を「全部のトークンを毎回処理する」前提から外せる可能性を示している。論文によれば、AdaLN条件付き予測器では50%疎化でも全トークン計画に近い性能を保ちつつ2.6倍速くなったため、制御タスクで計算資源の使い方を見直す材料になる。