何が起きたか

arXivに2026年7月29日付で掲載された論文「Mitigating Compounding Error via Video Representation Regularization」は、ビデオ拡散ベースの世界モデルにおける自己回帰生成の誤差蓄積問題を分析し、その原因が隠れ表現の次元崩壊にあると特定した。論文は、スライディングウィンドウ方式の自己回帰推論で生じる誤差の蓄積が、表現の有効ランクの急激な低下と同時に発生することを示した。さらに、データスケーリングだけでは誤差への耐性が向上しないという、主流のスケーリングパラダイムに反する結果を報告した。

詳細

ビデオ拡散世界モデルは、ロボティクス、自動運転、シミュレーションタスク向けの長期的な自己回帰ビデオ生成を可能にするが、スライディングウィンドウ方式の自己回帰推論では、時間とともにフレーム品質が劣化する深刻な誤差蓄積が生じる。この現象は広く観察されているものの、その根本的なメカニズムと長期的な安定生成の方法は未解明だった。 本研究では、ビデオ世界モデルの内部表現のダイナミクスを調査し、誤差蓄積が隠れ表現の次元崩壊と密接に関連することを発見した。具体的には、生成ドリフトの開始時にモデル表現の有効ランクが急激に減少し、表現の劣化と長期的なロールアウトの不安定性との間に強い関連があることを示した。 さらに、純粋なトレーニングデータのスケーリングでは誤差ドリフトへの耐性が向上しないことを発見し、これは主流のスケーリングパラダイムに反する。この問題に対処するため、潜在表現を安定化させ反復的な誤差蓄積を抑制する軽量なトレーニング制約である「ビデオ表現正則化」を提案した。 提案手法は、Diffusion Forcingと比較して、VBenchの美的品質指標で38.65から55.56へ、画質指標で44.37から72.08へ改善した。この研究は、自己回帰ビデオドリフトとモデル内部表現との最初の関連を確立し、誤差蓄積の定量的指標としてerankを採用し、ビデオ世界モデルにおけるスケーリングの限界を明らかにし、長いビデオ生成の堅牢性を向上させる単純で効果的な正則化戦略を提示している。

Key Facts

論文はarXivに2026年7月29日付で掲載された(ソース0)。[1]
ビデオ拡散ベースの世界モデルは、ロボティクス、自動運転、シミュレーションタスク向けの長期的な自己回帰ビデオ生成を可能にする(ソース0)。[1]
スライディングウィンドウ方式の自己回帰推論では、深刻な誤差蓄積が生じ、フレーム品質が時間とともに劣化する(ソース0)。[1]
誤差蓄積は隠れ表現の次元崩壊と密接に関連し、生成ドリフトの開始時に表現の有効ランクが急激に減少する(ソース0)。[1]
純粋なトレーニングデータのスケーリングでは誤差ドリフトへの耐性が向上しない(ソース0)。[1]
提案手法「ビデオ表現正則化」は、潜在表現を安定化させ反復的な誤差蓄積を抑制する軽量なトレーニング制約である(ソース0)。[1]
提案手法はDiffusion Forcingと比較して、VBenchの美的品質指標で38.65から55.56へ改善した(ソース0)。[1]
提案手法はDiffusion Forcingと比較して、VBenchの画質指標で44.37から72.08へ改善した(ソース0)。[1]
この研究は、自己回帰ビデオドリフトとモデル内部表現との最初の関連を確立し、誤差蓄積の定量的指標としてerankを採用した(ソース0)。[1]

なぜ重要か

この研究は、ビデオ世界モデルの長期的な安定生成における根本的な問題である誤差蓄積のメカニズムを、内部表現の次元崩壊として初めて説明した。また、データスケーリングの限界を示し、軽量な正則化手法で大幅な改善を達成したことは、今後のビデオ生成モデルの開発に重要な示唆を与える。