日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
DeepFake検出arXiv:2610.06339

BabelFake: 多言語音声視覚DeepFakeベンチマーク

BabelFake: A Multilingual Audio-Visual DeepFake Benchmark

シェア:XThreadsFacebookLINEはてブBluesky

同意を得た話者による5言語の音声視覚DeepFakeデータセットを構築し、最新の検出器の性能を評価した。

詳しい要約

1. どんなもの?

- 多言語の audio-visual DeepFake ベンチマーク BabelFake を提案 - 同意を得た参加者から収録し、399k clips(1,323時間)、496人、5言語(English, German, Italian, French, Spanish)を収録 - 11種類の modern video manipulation と4種類の voice cloning engine を組み合わせた modular な生成 pipeline を採用 - visual-only(face swapping)と joint audio-visual(lip synchronization, portrait animation)を区別して生成

2. 先行研究と比べてどこがすごい?

- 既存データセットは主に英語話者の映像で、古い manipulation や audio modality の欠如、同意なき人物使用が問題 - BabelFake は多言語・同意済み参加者・最新の audio-visual 生成手法を備える点で先行研究と異なる - 399k clips/1,323時間/496人/5言語という規模と、visual-only と joint audio-visual を分けた設計が特徴 - 既存ベンチマークとの直接比較の詳細は要旨からは不明

3. 技術・手法の肝は?

- modular な data generation pipeline を構築 - 11種類の modern video manipulation と4種類の voice cloning engine を組み合わせ - visual-only(face swapping)と joint audio-visual(lip synchronization, portrait animation)を区別 - 多言語・多人口統計のデータを収録し、cross-language/demographic 評価を可能にする設計

4. どうやって有効だと検証した?

- state-of-the-art detectors をベンチマーク - audio-visual generation pairing により detection difficulty が変化し、authentic audio を保持した場合に性能が大幅低下することを示す - cross-language/demographic 評価で detector architecture と training data による感度差を確認 - human evaluation により、知覚される realism と machine-detection difficulty が必ずしも一致しないことを示す

5. 議論はある?

- detection difficulty は audio-visual generation pairing に依存し、authentic audio 保持時に性能劣化が大きい - cross-language/demographic で detector の感度が architecture や training data により異なる - human の知覚 realism と machine detection の難しさは一致しない可能性 - 具体的な限界や倫理的議論の詳細は要旨からは不明

6. 次に読むべき論文は?

- 要旨で参照/比較されている個別研究は明記されていない - 同分野の定番として audio-visual DeepFake detection、face swapping、lip synchronization、portrait animation、voice cloning に関する既存ベンチマーク(例: FaceForensics++, DFDC, FakeAVCeleb など一般名)を次に読む候補として挙げる

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Carlotta Segna, Joel Tschesche, Anna Rohrbach

分類: cs.CV

原文アブストラクト

Reliable and practical audio-visual DeepFake detection requires benchmarks that reflect diverse linguistic contexts and modern data synthesis pipelines for visual as well as audio manipulations. However, existing datasets predominantly contain footage of English-speakers, often include outdated manipulation types, or overlook the audio modality. Further, many datasets feature individuals who did not consent to be used in DeepFake creation. We introduce BabelFake, a multilingual audio-visual DeepFake benchmark recorded with consenting participants. BabelFake contains 399k clips (1,323 hours) from 496 individuals spanning five languages (English, German, Italian, French, Spanish). Our modular data generation pipeline pairs 11 modern video manipulation methods with 4 voice cloning engines, distinguishing visual-only (face swapping) and joint audio-visual manipulations (lip synchronization and portrait animation). By benchmarking state-of-the-art detectors, we show that detection difficulty depends on the audio-visual generation pairing, with substantial performance degradation when authentic audio is preserved. Cross-language/demographic evaluation reveals sensitivity varying across detector architectures and training data, while human evaluation reveals that perceived realism and machine-detection difficulty do not necessarily align.

関連論文

PR本紙発行元 EmplifAI