日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ビデオ生成arXiv:2608.01127

MiniWorld: ビデオワールドモデルのスクラッチ学習を民主化する

MiniWorld: Democratizing the Training of Video World Models from Scratch

シェア:XThreadsFacebookLINEはてブBluesky

ビデオワールドモデルをスクラッチから効率的に学習するための軽量で再現可能なフレームワークMiniWorldを提案した。

詳しい要約

1. どんなもの?

MiniWorldは、ビデオワールドモデルをスクラッチから訓練するための再現可能なフレームワークである。ビデオワールドモデルは、過去の観測と制御信号に基づいて将来の観測を予測し、自己回帰的な状態遷移により長期的な生成を可能にする。MiniWorldは、事前学習されたVideo VAEの潜在空間において、Flow Matchingで訓練されたブロック因果Video Diffusion Transformerを採用する。また、Diffusion Forcingに基づき、チャンク単位の非減少ノイズスケジュールと二段階の継続訓練を導入し、時間的モデリングと安定性を向上させる。推論時には、ローリングKVキャッシュとパイプライン化された非同期デノイジングを組み合わせ、制限された計算リソースで効率的なストリーミング生成を実現する。モデル全体は、8GPUサーバ1台で数日以内に訓練可能である。

2. 先行研究と比べてどこがすごい?

従来のビデオワールドモデル研究は、事前学習済みのビデオ生成モデルをポストトレーニングや蒸留によって適応させることが主流であり、複雑な訓練パイプラインや多大な計算リソースを必要とし、双方向事前学習と因果的ストリーミング推論のミスマッチという問題があった。近年、自己回帰型ビデオワールドモデルをスクラッチから訓練することが可能でスケーラブルであると示されたが、軽量で透明性が高く、完全に再現可能なベースラインは存在しなかった。MiniWorldは、スクラッチからの訓練を可能にし、単一の8GPUサーバで数日以内に訓練できる軽量なフレームワークを提供する点で優れている。

3. 技術・手法の肝は?

MiniWorldの技術的な肝は、ブロック因果Video Diffusion TransformerをFlow Matchingで訓練する点にある。具体的には、事前学習されたVideo VAEの潜在空間で動作し、Diffusion Forcingに基づくチャンク単位の非減少ノイズスケジュールを採用することで、時間的依存関係を効果的にモデル化する。さらに、二段階の継続訓練により安定性を向上させる。推論時には、ローリングKVキャッシュとパイプライン化された非同期デノイジングを組み合わせることで、計算リソースを制限しつつ効率的なストリーミング生成を実現する。

4. どうやって有効だと検証した?

要旨からは、MiniWorldの有効性を検証した具体的な実験結果や評価指標は不明である。ただし、モデル全体が単一の8GPUサーバで数日以内に訓練可能であること、およびコードベースと事前学習済みチェックポイントを公開することで再現性を提供していることが述べられている。

5. 議論はある?

要旨からは、MiniWorldの限界や議論についての詳細は不明である。ただし、従来の事前学習モデル適応アプローチと比較して、スクラッチからの訓練が計算効率と再現性の面で利点を持つ可能性が示唆されている。また、ブロック因果設計とDiffusion Forcingの組み合わせが時間的モデリングに与える影響や、ストリーミング推論の効率性についての議論が考えられるが、要旨には明記されていない。

6. 次に読むべき論文は?

要旨で参照されている研究として、Diffusion Forcingが挙げられる。また、関連する手法として、事前学習済みビデオ生成モデルを利用したビデオワールドモデルのポストトレーニングや蒸留に関する研究、および自己回帰型ビデオワールドモデルのスクラッチ訓練に関する最近の研究が考えられる。具体的な論文名は要旨にないため、同分野の定番として、Video World ModelやDiffusion Forcingに関する論文を読むことが推奨される。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Yian Zhao, Ruochong Zheng, Hongcan Guo, Yu Yan, Jian Zhang, Jie Chen

分類: cs.CV

原文アブストラクト

Video world models predict future observations conditioned on historical observations and control signals, enabling long-horizon generation through autoregressive state transitions. Unlike conventional video generation models that primarily capture visual appearance and motion, video world models learn the underlying dynamics governing environment evolution under agent actions, providing a foundation for embodied AI and interactive simulation. Recent progress has largely relied on adapting pretrained video generation models through post-training or distillation. Although effective, these approaches often require complex training pipelines, substantial computational resources, and suffer from the mismatch between bidirectional pretraining and causal streaming inference. Recent studies have shown that training autoregressive video world models from scratch is feasible and scalable. However, the community still lacks a lightweight, transparent, and fully reproducible baseline trainable end-to-end with modest computational resources. We present MiniWorld, a reproducible framework for training streaming video world models from scratch. MiniWorld employs a block-causal Video Diffusion Transformer trained with Flow Matching in the latent space of a pretrained Video VAE. Building on Diffusion Forcing, it adopts a chunk-wise non-decreasing noise schedule and two-stage continued training to improve temporal modeling and stability. During inference, MiniWorld combines a rolling KV cache with pipelined asynchronous denoising for efficient streaming generation under bounded computation. The entire model can be trained within several days on a single 8-GPU server. By releasing the training and inference codebase and pretrained checkpoints, we hope MiniWorld will facilitate future research on video world modeling.

関連論文