何が起きたか
2026年8月7日にarXivで公開された論文「Addressable Memory for Video World Models」において、研究チームは動画世界モデルの長期記憶を改善するフレームワーク「WorldTrace」を提案した。このフレームワークは、モデルの再学習を必要とせず、Key-Valueキャッシュの圧縮時に記憶を参照可能な状態に保つ。評価用に新たに導入されたベンチマーク「LoopBench」では、WorldTrace-Fieldが時間的一貫性を+15.5%、WorldTrace-Landmarkがエピソード想起を+19.5%向上させた。
詳細
動画世界モデルは、Key-Valueキャッシュを視覚記憶として利用し、生成済みフレームを保持する。しかし、ロールアウトが学習時の範囲を超えると、時間的RoPEオフセットが学習範囲外となり、モデルが注意機構を通じて記憶を参照できなくなる。さらに、RoPE回転空間でキャッシュを単純に圧縮すると、互換性のない位置位相が平均化され、記憶が劣化する。 WorldTraceは、各サマリスロットに学習範囲内の仮想位置を割り当てることで、圧縮後も記憶を参照可能にする。圧縮手法として、時間的一貫性を重視するWorldTrace-Fieldと、シーン遷移時に逐語的なシーントレースを保存するWorldTrace-Landmarkの2つを提案している。LoopBenchは、長い迂回の後に以前訪れたシーンを再構成できるかを評価するベンチマークである。
Key Facts
| 論文「Addressable Memory for Video World Models」がarXivで公開された(2026年8月7日、ID: 2608.07408v1)。 | [1] |
| 動画世界モデルはKey-Valueキャッシュを視覚記憶として利用する。 | [1] |
| ロールアウトが学習範囲を超えると、時間的RoPEオフセットが学習範囲外となり、記憶の参照が困難になる。 | [1] |
| RoPE回転空間での単純なキャッシュ圧縮は、互換性のない位置位相の平均化により記憶を劣化させる。 | [1] |
| WorldTraceは学習不要のメモリフレームワークで、各サマリスロットに学習範囲内の仮想位置を割り当てる。 | [1] |
| WorldTrace-Fieldは時間的一貫性を+15.5%向上させた。 | [1] |
| WorldTrace-Landmarkはエピソード想起を+19.5%向上させた。 | [1] |
| LoopBenchは、圧縮キャッシュが長い迂回後に以前訪れたシーンを再構成できるかを評価するベンチマークである。 | [1] |
なぜ重要か
この研究は、動画世界モデルの長期記憶の課題を明確にし、再学習なしで改善する手法を提案している。LoopBenchの導入により、記憶圧縮手法の評価が可能になり、今後の研究の基準となる可能性がある。