日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
動画生成arXiv:2610.01039

合成状態遷移による動画インタラクション生成のブートストラップ

Bootstrapping Video Interaction Generation with Synthetic State Transitions

シェア:XThreadsFacebookLINEはてブBluesky

画像編集モデルで相互作用の開始・終了状態画像を作り、State-Guided Samplingで滑らかな動画を生成する合成データセットを構築し、ファインチューニングで物理的に妥当なインタラクション生成を改善した。

詳しい要約

1. どんなもの?

- ビデオ生成モデルが物理的相互作用と状態遷移を描くのが難しい問題に対処 - 制御可能な相互作用のスケーラブルな合成データセットを生成するフレームワークを提案 - 構造化された分類法と画像編集モデルを活用し、明示的な「開始」と「終了」の状態画像を作成 - これらのアンカーを用いてシームレスなビデオを生成するState-Guided Sampling (SGS)を提案 - 自動評価システムを開発し、人間の判断と一致することを検証

2. 先行研究と比べてどこがすごい?

- 従来のビデオ生成モデルは高忠実度のビデオを合成できるが、物理的相互作用や状態遷移の描写が不十分 - 提案フレームワークは合成データセットを生成し、ベースモデルのファインチューニングにより相互作用生成能力を大幅に向上 - 自動評価システムは人間の判断と整合し、データ品質を保証

3. 技術・手法の肝は?

- 構造化された分類法と最先端の画像編集モデルを用いて、相互作用の視覚的アンカーとなる開始・終了状態画像を生成 - State-Guided Sampling (SGS)を提案し、単純な条件付き生成で生じるアーティファクトを軽減 - 自動評価システムを開発し、人間の判断と一致するように調整

4. どうやって有効だと検証した?

- 実験により、提案データセットでベースモデルをファインチューニングすると、もっともらしい相互作用を生成する能力が大幅に向上することを示した - 自動評価システムが人間の判断と一致することを検証

5. 議論はある?

- 要旨からは不明

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究は明示されていない - 同分野の定番として、Video Diffusion Models, Imagen Video, Make-A-Video, などのビデオ生成モデルが挙げられる

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Jiho Jang, Jinyoung Kim, Nojun Kwak, Kyungjune Kim

分類: cs.CV

原文アブストラクト

While recent video generative models can synthesize high-fidelity videos, they struggle to portray plausible physical interactions and the resulting state transitions, a critical bottleneck for applications in robotics and VR/AR. To address this, we introduce a framework to generate a scalable synthetic dataset of controllable interactions. Our pipeline leverages a structured taxonomy and state-of-the-art image editing models to create explicit `start' and `end' state images, which serve as visual anchors for the interaction. To generate a seamless video utilizing these anchors, we propose State-Guided Sampling (SGS), a novel sampling technique that mitigates artifacts common in naive conditional generation. Furthermore, we develop and validate a new automated evaluation system that aligns with human judgments to ensure data quality. Experiments show that fine-tuning a base model on our dataset significantly enhances its ability to generate plausible interactions.

関連論文

PR本紙発行元 EmplifAI