何が起きたか
arXivに2026-10-08付で掲載された論文で、研究者らは「WAM-Cache: Staleness-Bounded KV Reuse for Efficient World Action Models」を公表した。World Action Modelsで毎チャンク実行される動画DiTのprefillが計算負荷の大半を占める点に対し、WAM-Cacheはlayerwise key-valueをチャンク間で再利用し、少数のトークンだけを更新する。
詳細
手法は訓練不要で、更新対象の選定にアクションエキスパートのcross-attentionとvisual latent surpriseを組み合わせ、さらにstrict age boundで誤差の累積を抑える設計である。論文は、視覚的に変化したトークンを更新する単純なヒューリスティックは、真のKV driftを予測するoracleを用いても密なベースラインに届かないと指摘している。 実験ではFast-WAM上で、RoboTwin 2.0、LIBERO、実機環境におけるvideo DiT prefill FLOPsを32〜42%削減し、シミュレーションではdense policyとの差を0.7〜1.8ポイント、実機では2.5ポイントに収めたとしている。
Key Facts
| WAM-CacheはWorld Action Models向けの訓練不要な高速化枠組みである。 | [1] |
| 動画DiTのprefillは各チャンクで実行される処理で、論文はその計算負荷が大きいと述べている。 | [1] |
| WAM-Cacheはlayerwise key-valueをチャンク間で保持し、必要なトークンのみを再計算する。 | [1] |
| 更新対象の選定にはcross-attention、visual latent surprise、strict age boundを使う。 | [1] |
| Fast-WAM上でvideo DiT prefill FLOPsを32〜42%削減し、実機ではdense policyとの差が2.5ポイントだった。 | [1] |
本紙の見方
WAM-Cacheの新しさは、World Action Modelsの推論を単純に軽くするのではなく、動画DiTのprefillに限ってKVを再利用し、更新範囲を選別する点にある。既定路線の延長としては、訓練不要の高速化であり、モデル再学習を前提にしない点が既存の推論最適化と連続している。一方で、論文は「見た目が変わったトークン」を機械的に更新するだけでは不十分だとしており、更新の基準を視覚変化ではなく、アクションエキスパートがどこに注意を向けるかへ寄せている。ここには、ロボット操作で必要な情報が必ずしも画素変化と一致しないという問題設定がある。 本紙の観点では、これは計算基盤の削減であると同時に、実世界行動モデルの入出力構造を再定義する試みである。つまり、ボトルネックはモデル規模そのものより、チャンクごとの前処理コストにあるという整理だと読める。実機で2.5ポイント以内の差にとどめたことは、計算削減がシミュレーション限定ではないことを示す一方、密なベースラインとの差が残る以上、どのタスクで許容できるかが次の焦点になる。 業界構造への含意は、ロボットの学習済み方策を支える周辺計算の最適化にある。アクション精度を決めるのが「何が動いたか」ではなく「エキスパートがどこを見るか」だとするなら、今後は視覚エンコーダ単体の改善より、注意機構とキャッシュ制御の設計が競争点になりやすい。特に実機で2.5ポイント差という数字は、現場導入ではレイテンシと精度のどちらを優先するかの判断が必要になることを示す。未確定論点は、どの程度の長期実行でstrict age boundが効くのか、別のロボット操作ベンチマークでも同様の削減率が出るのか、そしてキャッシュ保持による失敗モードがどのタスクで顕在化するかである。
なぜ重要か
論文が示した32〜42%のFLOPs削減は、World Action Modelsを実機寄りの負荷条件で動かす際の計算制約に直接関係する。特に実機でdense policyとの差を2.5ポイントに抑えた点は、速度最適化が実運用の選択肢になり得ることを示す一方、適用条件の見極めが必要だと分かる。