Richard Zhang
収録論文 4本 ・ フィジカルAI/ロボット学習
ビデオ生成/編集生成モデルデータ帰属
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EditStream: 対話型ビデオ生成と編集のための統一オートリグレッシブフレームワークビデオ生成/編集2026/8/16
ビデオ生成と編集を単一のDiTベースモデルで統合し、高速な数ステップのオートリグレッシブモデルに変換するフレームワークを提案。テキストからビデオ、画像からビデオ、編集伝播など多様なタスクをサポートし、対話的なクリエイティブワークフローを実現する。
- 表現オートエンコーダによる改良ベースライン生成モデル2026/5/18
表現オートエンコーダ(RAE)の設計を改良し、再構成性能と収束速度を大幅に向上させた。特に、層の和を用いた表現、REPAとの相補性、CFGのための無料ガイダンスを実現した。
- テキスト画像生成モデルのための高速データ帰属データ帰属2025/11/13
テキストから画像を生成するモデルにおいて、生成結果に影響を与えた学習画像を高速に特定する手法を提案。既存手法より最大40万倍高速で、大規模モデルにも適用可能。
- Stochastic Adversarial Video Prediction2018/4/1