日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ビデオ生成/編集arXiv:2608.21424

EditStream: 対話型ビデオ生成と編集のための統一オートリグレッシブフレームワーク

EditStream: A Unified Autoregressive Framework for Interactive Video Generation and Editing

シェア:XThreadsFacebookLINEはてブBluesky

ビデオ生成と編集を単一のDiTベースモデルで統合し、高速な数ステップのオートリグレッシブモデルに変換するフレームワークを提案。テキストからビデオ、画像からビデオ、編集伝播など多様なタスクをサポートし、対話的なクリエイティブワークフローを実現する。

詳しい要約

1. どんなもの?

EditStreamは、インタラクティブなビデオ生成と編集のための統一フレームワークである。単一のDiTベースのモデル内で、Text-to-Video、Image-to-Video、Video-to-Video、Editing Propagation、Reference-guided Video Editing、Camera Pose Changeなど複数のビデオ生成・操作タスクを、タスク固有の条件付けによって統合する。さらに、このモデルを高速な数ステップの自己回帰モデルに変換し、効率的なストリーミングを実現する。

2. 先行研究と比べてどこがすごい?

先行研究では、ビデオ生成と編集の各タスクが個別のモデルで扱われることが多く、統一的なフレームワークが不足していた。EditStreamは、単一のDiTベースモデルで複数のタスクを統合し、さらに数ステップの自己回帰モデルへの蒸留により、インタラクティブな使用に適した高速化を実現している点が優れている。

3. 技術・手法の肝は?

手法の肝は、2段階の蒸留アプローチである。第一段階ではVelocity Moment Matching (VMM)を用いて、学生モデルが到達した中間状態での条件付き速度モーメントを一致させ、生成品質と動きを維持する。第二段階では自己回帰的なアンローリングにより、学生モデルを自身の自己回帰予測にさらし、時間的安定性を向上させる。これにより、数ステップ自己回帰ビデオ生成における過飽和、動きの劣化、時間的不安定性、複雑なトレーニングといった課題を軽減する。

4. どうやって有効だと検証した?

要旨からは、具体的な検証方法(データセットや比較実験など)は不明である。ただし、EditStreamが実用的でスケーラブルなソリューションを提供し、高品質な拡散ベースのビデオモデルとインタラクティブなクリエイティブワークフローを橋渡しすると述べられている。

5. 議論はある?

要旨からは、議論や限界についての具体的な記述は不明である。ただし、数ステップ自己回帰ビデオ生成における一般的な課題(過飽和、動きの劣化、時間的不安定性、複雑なトレーニング)を挙げており、それらをVMMとアンローリングで軽減するとしている。

6. 次に読むべき論文は?

要旨で参照されている関連手法として、Velocity Moment Matching (VMM)や自己回帰的アンローリングが挙げられる。また、DiTベースのモデルや拡散ベースのビデオ生成モデルに関する研究が関連する。具体的な論文名は不明だが、同分野の定番として、拡散モデルを用いたビデオ生成やDiTアーキテクチャに関する論文が考えられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Yuqian Zhou, Zhenghong Zhou, Zongze Wu, Cameron Smith, Richard Zhang, Jiebo Luo, Eli Shechtman, Zhe Lin

分類: cs.CV, cs.GR, cs.HC, cs.LG, cs.MM

原文アブストラクト

Interactive video generation and editing are becoming increasingly important for creative design. In this report, we introduce EditStream: a unified framework for interactive video generation and editing. EditStream unifies multiple video creation and manipulation tasks within a single DiT-based model through flexible task-specific conditioning, and further transforms it into a fast, few-step autoregressive model for efficient streaming. It supports Text-to-Video, Image-to-Video, Video-to-Video, Editing Propagation, Reference-guided Video Editing, and Camera Pose Change, enabling flexible control over video generation, transformation, and editing within one system. To make the unified model practical for interactive use, we develop a two-stage distillation approach that combines Velocity Moment Matching (VMM) with autoregressive unrolling. VMM matches conditional velocity moments at student-reached intermediate states to preserve generation quality and motion, while unrolling exposes the student to its own autoregressive predictions to improve temporal stability. Together, they alleviate common challenges in few-step autoregressive video generation, including over-saturation, degraded motion, temporal instability, and complex training. EditStream provides a practical and scalable solution that bridges high-quality diffusion-based video models with interactive creative workflows.