ChatPaper.aiChatPaper

ArtifactNet : Détection de musique générée par IA via la physique résiduelle médico-légale

ArtifactNet: Detecting AI-Generated Music via Forensic Residual Physics

April 17, 2026
Auteurs: Heewon Oh
cs.AI

Résumé

Nous présentons ArtifactNet, un cadre léger qui détecte la musique générée par IA en reformulant le problème comme une physique médico-légale — en extrayant et analysant les artefacts physiques que les codecs audio neuronaux impriment inévitablement sur l'audio généré. Un UNet à masque borné (ArtifactUNet, 3,6 millions de paramètres) extrait les résidus des codecs des spectrogrammes d'amplitude, qui sont ensuite décomposés via HPSS en caractéristiques médico-légales à 7 canaux pour la classification par un CNN compact (0,4 million de paramètres ; 4,0 millions au total). Nous introduisons ArtifactBench, un benchmark d'évaluation multi-générateur comprenant 6 183 pistes (4 383 IA provenant de 22 générateurs et 1 800 réelles provenant de 6 sources diverses). Chaque piste est étiquetée avec `bench_origin` pour une évaluation zero-shot équitable. Sur la partition de test non vue (n=2 263), ArtifactNet atteint F1 = 0,9829 avec FPR = 1,49 %, contre CLAM (F1 = 0,7576, FPR = 69,26 %) et SpecTTTra (F1 = 0,7713, FPR = 19,43 %) évalués dans des conditions identiques avec les points de contrôle publiés. L'entraînement prenant en compte le codec (augmentation 4-voies WAV/MP3/AAC/Opus) réduit en outre la dérive de probabilité inter-codec de 83 % (Delta = 0,95 -> 0,16), résolvant le principal mode de défaillance d'invariance au codec. Ces résultats établissent la physique médico-légale — l'extraction directe des artefacts au niveau du codec — comme un paradigme plus généralisable et économe en paramètres pour la détection de la musique IA que l'apprentissage de représentation, utilisant 49 fois moins de paramètres que CLAM et 4,8 fois moins que SpecTTTra.
English
We present ArtifactNet, a lightweight framework that detects AI-generated music by reframing the problem as forensic physics -- extracting and analyzing the physical artifacts that neural audio codecs inevitably imprint on generated audio. A bounded-mask UNet (ArtifactUNet, 3.6M parameters) extracts codec residuals from magnitude spectrograms, which are then decomposed via HPSS into 7-channel forensic features for classification by a compact CNN (0.4M parameters; 4.0M total). We introduce ArtifactBench, a multi-generator evaluation benchmark comprising 6,183 tracks (4,383 AI from 22 generators and 1,800 real from 6 diverse sources). Each track is tagged with bench_origin for fair zero-shot evaluation. On the unseen test partition (n=2,263), ArtifactNet achieves F1 = 0.9829 with FPR = 1.49%, compared to CLAM (F1 = 0.7576, FPR = 69.26%) and SpecTTTra (F1 = 0.7713, FPR = 19.43%) evaluated under identical conditions with published checkpoints. Codec-aware training (4-way WAV/MP3/AAC/Opus augmentation) further reduces cross-codec probability drift by 83% (Delta = 0.95 -> 0.16), resolving the primary codec-invariance failure mode. These results establish forensic physics -- direct extraction of codec-level artifacts -- as a more generalizable and parameter-efficient paradigm for AI music detection than representation learning, using 49x fewer parameters than CLAM and 4.8x fewer than SpecTTTra.