日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
音声映像生成arXiv:2608.05803

Vorch-Omni: 視覚と聴覚のマルチタスク統合オーケストレーション

Vorch-Omni: Multi-Task Orchestration of Sight and Sound

シェア:XThreadsFacebookLINEはてブBluesky

音声と映像の生成・編集・参照合成を単一モデルで統一的に扱うマルチタスクフレームワークを提案し、条件付けマスクとタスク識別子により多様な入出力構成を柔軟に処理する。

詳しい要約

1. どんなもの?

Vorch-Omniは、音声と映像の生成・編集を統一的に扱うマルチタスクフレームワーク。任意の条件(テキスト、画像、音声、映像など)から任意の出力(映像、音声、またはその両方)を生成する「arbitrary-condition-to-arbitrary-output」という定式化に基づく。単一のflow-matching diffusion transformerを用いて、text-to-video、text-to-audio-video、image-conditioned generation、reference-conditioned generation、temporal extension、audio-driven generation、video transformation、audio-visual editingなど10以上のタスクをサポートする。

2. 先行研究と比べてどこがすごい?

従来の生成モデルはタスクごとに個別のモデルを必要とし、断片的であった。Vorch-Omniは、タスク固有のアーキテクチャ変更なしに、単一のモデルで多様なタスクを統一的に扱う点が新しい。特に、異種のターゲット・ソース・参照信号を区別し、タスク間の干渉を減らすためのトークンレベルの条件付けマスクとタスク識別子を導入している。また、音声と映像の同時生成における多様な条件付けと出力構成の課題に対処している。

3. 技術・手法の肝は?

手法の核は、トークンレベルの条件付けマスクとタスク識別子を用いて、ターゲット、ソースコンテンツ、参照を区別すること。さらに、位置タイプによって時間的文脈と独立した条件を分離する。視覚的条件付けには、視覚言語モデル(VLM)がサンプリングされたフレームとテキスト命令を解釈する経路と、ビデオVAEが条件を潜在トークンにエンコードして直接ガイダンスを提供する経路の2つを相補的に使用する。データパイプラインでは、時間的に整列した音声映像クリップを収集し、構造化されたキャプションとメタデータを生成し、タスク分布のバランスを取る。

4. どうやって有効だと検証した?

要旨からは、具体的な検証方法(ベンチマークや比較実験など)は不明。ただし、10以上のタスクをサポートすると述べており、各タスクでの生成品質や編集性能を評価したと推測されるが、詳細は要旨に記載がない。

5. 議論はある?

要旨からは、議論や限界についての言及はない。ただし、統一モデルによるタスク間の干渉を減らすための工夫が述べられており、その効果や限界については今後の検証が必要と考えられる。また、データパイプラインの構築やタスク分布のバランス調整が重要であると示唆されるが、具体的な課題は不明。

6. 次に読むべき論文は?

要旨で参照されている先行研究や関連手法は明示されていないが、同分野の定番として、映像生成ではVideo Diffusion Models、音声生成ではAudioLDM、音声映像生成ではMM-DiffusionやVideoPoetなどが考えられる。また、統一マルチタスクモデルとしては、Unified-IOやOmni-modalモデルなどが関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Vorch Team, Xiaoyu Chen, Yang Ding, Cong Han, Menglin Han, Yuxin Hong, Jiebo Hou, Zequn Jie, Xiang Li, Jing Liu, Qi Liu, Yulei Lu, Siyuan Luo, Lin Ma, Xin Ma, Yinlong Qian, Peng Shi, Fang Wan, Siqi Wang, Yaohui Wang, Yaole Wang, Yidi Wu, Siqian Yang, Mingyu Yin, Haoran Yu, Gang Yue, Lisai Zhang, Yuting Zhang

分類: cs.CV

原文アブストラクト

Recent advances in generative video modeling have enabled diverse generation, reference-based synthesis, extension, and editing, but existing approaches often rely on fragmented task-specific models. A general model must distinguish heterogeneous target, source, and reference signals to determine what to generate, preserve, or use as guidance, while reducing interference among tasks. Joint audio-visual generation further increases this challenge by introducing diverse conditioning and output configurations across modalities. We present Vorch-Omni, a unified multi-task framework for audio-visual synthesis based on an arbitrary-condition-to-arbitrary-output formulation. It flexibly treats video and audio signals as either conditioning inputs or generation targets. Token-level conditioning masks and task identifiers distinguish targets, source content, and references, while position types separate temporal context from independent conditions. To capture semantic and structural information, Vorch-Omni employs complementary visual conditioning pathways: a vision-language model interprets sampled frames with text instructions, and a video VAE encodes conditions into latent tokens for direct guidance. We further build a distributed data pipeline to curate diverse temporally aligned audio-visual clips, generate structured captions and metadata, and balance heterogeneous task distributions. Built on a single flow-matching diffusion transformer without task-specific architectural changes, Vorch-Omni supports over 10 tasks, including text-to-video, text-to-audio-video, image- and reference-conditioned generation, temporal extension, audio-driven generation, video transformation, and audio-visual editing. This unified framework provides a scalable foundation for general-purpose audio-visual generation and manipulation.