ChatPaper.aiChatPaper

De alpha blending-hypothese: compositing shortcut in deepfake-detectie

The Alpha Blending Hypothesis: Compositing Shortcut in Deepfake Detection

May 11, 2026
Auteurs: Andrii Yermakov, Jan Cech, Mario Fritz, Jiri Matas
cs.AI

Samenvatting

Recente methoden voor deepfake-detectie tonen een verbeterde generalisatie over datasets aan, maar de onderliggende mechanismen blijven onderbelicht. Wij introduceren de Alpha Blending-hypothese, die stelt dat geavanceerde framebased detectoren primair functioneren als zoekers naar alfamenging; in plaats van semantische anomalieën of specifieke generatieve neurale vingerafdrukken te leren, lokaliseren zij laagwaardige compositieartefacten die worden geïntroduceerd tijdens de integratie van gemanipuleerde gezichten in doelframes. Wij valideren de hypothese experimenteel en tonen aan dat deepfake-detectoren een hoge gevoeligheid vertonen voor zogenaamde zelfgemengde beelden (Self-Blended Images, SBI) en niet-generatieve manipulaties. Wij stellen de methode BlenD voor, die gebruikmaakt van een grootschalige, diverse dataset met uitsluitend echte gezichtsafbeeldingen, verrijkt met SBI. Deze benadering behaalt de beste gemiddelde generalisatie over datasets op 15 compositorische deepfake-datasets die tussen 2019 en 2025 zijn uitgebracht, zonder expliciet gegenereerde deepfakes te gebruiken tijdens de training. Bovendien tonen wij aan dat voorspellingen van expliciete mengingszoekers en modellen die bestand zijn tegen mengingsshortcuts sterk complementair zijn, wat een state-of-the-art AUROC van 94,0% oplevert in een ensembleconfiguratie. De code met experimenten en het getrainde model zullen openbaar worden vrijgegeven.
English
Recent deepfake detection methods demonstrate improved cross-dataset generalization, yet the underlying mechanisms remain underexplored. We introduce the Alpha Blending Hypothesis, positing that state-of-the-art frame-based detectors primarily function as alpha blending searchers; rather than learning semantic anomalies or specific generative neural fingerprints, they localize low-level compositing artifacts introduced during the integration of manipulated faces into target frames. We experimentally validate the hypothesis, demonstrating that deepfake detectors exhibit high sensitivity to the so-called self-blended images (SBI) and non-generative manipulations. We propose the method BlenD that leverages a large-scale, diverse dataset of real-only facial images augmented with SBI. This approach achieves the best average cross-dataset generalization on 15 compositional deepfake datasets released between 2019 and 2025 without utilizing explicitly generated deepfakes during training. Furthermore, we show that predictions from explicit blending searchers and models resilient to blending shortcuts are highly complementary, yielding a state-of-the-art AUROC of 94.0% in an ensemble configuration. The code with experiments and the trained model will be publicly released.