日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
画像改ざん検出arXiv:2608.20929

GAP-SAM: グローバルアーティファクト事前情報による汎用的なAI生成画像改ざん位置特定

GAP-SAM: A Global Artifact Prior for Generalizable AI-Generated Image Manipulation Localization

シェア:XThreadsFacebookLINEはてブBluesky

AI生成画像の改ざん位置を特定する手法で、画像とそのVAE再構成からグローバルなアーティファクト情報を抽出し、SAM3の特徴ピラミッドに注入することで、セマンティック境界への過学習を抑えつつ高い汎化性能を実現した。

詳しい要約

1. どんなもの?

GAP-SAMは、AI生成画像の操作位置特定(manipulation localization)のための手法である。画像とその凍結されたVAE再構成をエンコードしてグローバルアーティファクトトークンを生成し、SAM3の特徴ピラミッドにゼロゲートFiLMを介して注入することで、画素レベルのデコードを調整し、セマンティック境界へのショートカットを抑制しつつ、局所化性能を維持する。

2. 先行研究と比べてどこがすごい?

従来の局所化手法はOOD性能が画像レベルの検出に劣っていた。これは画素レベルの教師信号が、データセット固有のマスク形状やセマンティック境界とフォレンジック証拠を絡めるためである。GAP-SAMは、空間領域を事前に指定せずにグローバルアーティファクトトークンを注入することで、セマンティック境界へのショートカット(boundary adhesion)を抑制し、既存手法を大きく上回る性能を達成した。

3. 技術・手法の肝は?

GAP-SAMは、画像とその凍結VAE再構成をエンコードしてグローバルアーティファクトトークンを生成し、SAM3の特徴ピラミッドにゼロゲートFiLMを介して注入する。ゼロゲートにより初期は影響を抑え、学習中に徐々に有効化する。これにより、空間領域を指定せずに密なデコードを調整し、セマンティック境界へのショートカットを防ぐ。

4. どうやって有効だと検証した?

6つのデータセットで評価し、平均Pixel-F1が79.8で、最強の先行手法を12.6ポイント上回った。また、JPEG圧縮、ガウシアンブラー、リサイズの各強度でも最良の性能を示した。

5. 議論はある?

要旨からは、COCO-ControlNetによる分布整合が有効である一方、Mask-VAE再構成整合は局所的な拡散インペインティングアーティファクトへの転移が悪いことが示された。また、boundary adhesion現象が特定され、GAP-SAMがそれを抑制することが確認された。しかし、GAP-SAMの限界や他の操作タイプへの一般化については要旨からは不明。

6. 次に読むべき論文は?

要旨で参照されているCOCO-ControlNet、Mask-VAE、SAM3に関する論文。また、AI生成画像検出の分野では、画像レベルの検出手法(例えば、一般的なCNNやTransformerベースの検出器)も関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Haozhen Yan, Siyuan Shan, Zijian Yu, Youqi Wang, Yan Hong, Jun Lan, Jianfu Zhang

分類: cs.CV

原文アブストラクト

AI-generated image manipulation localization identifies edited pixels, but its OOD performance lags behind image-level detection partly because pixel supervision entangles forensic evidence with dataset-specific mask geometry and semantic boundaries. Extending image-level distribution alignment to localization, we construct COCO-ControlNet with source-image Canny edges and depth maps to align semantics and geometry, improving OOD performance across multiple localizers. Yet tighter Mask-VAE Reconstruction Alignment (Mask-VAE) underperforms COCO-ControlNet, showing that VAE reconstruction artifacts transfer poorly to local diffusion-inpainting artifacts. We also identify \emph{boundary adhesion}, where fine-tuned segmentation models snap predictions to semantic object contours rather than true manipulation boundaries. These findings motivate GAP-SAM, which encodes an image and its frozen VAE reconstruction into a global artifact token and injects it into SAM3's feature pyramid via zero-gated FiLM before pixel decoding. Without prescribing a spatial region, this token modulates dense decoding to preserve localization while suppressing semantic-boundary shortcuts. Across six datasets, GAP-SAM averages 79.8 Pixel-F1, outperforming the strongest prior method by 12.6 points. It also performs best at every tested severity of JPEG compression, Gaussian blur, and resizing.

関連論文