ChatPaper.aiChatPaper

WARP: Gewichtsruimte-analyse voor het terugwinnen van trainingsdataportfolios

WARP: Weight-Space Analysis for Recovering Training Data Portfolios

July 2, 2026
Auteurs: Tzu-Heng Huang, Aditya Goyal, John Cooper, Frederic Sala
cs.AI

Samenvatting

Fundamentmodellen worden routinematig aan het publiek vrijgegeven, maar de datarecepten die worden gebruikt om ze te trainen – zoals domeinmenggewichten die bepalen hoe verschillende bronnen worden gesampled – worden zelden openbaar gemaakt. Dit creëert een asymmetrie in toegang: onderzoekers bestuderen de resulterende modellen, maar hebben geen inzicht in de trainingsverdeling die deze produceert. Eerdere methoden voor het afleiden van trainingsdata, zoals lidmaatschapsinferentie, detecteren op het niveau van individuele samples en kunnen daarom niet de globale samenstelling van het trainingscorpus karakteriseren. We introduceren WARP, een raamwerk dat de trainingsmengsels van een fijn afgesteld model direct uit de vrijgegeven gewichten terugwint. WARP interpoleert tussen het basis- en het fijn afgestelde model met behulp van modelsamenvoeging, waardoor pseudo-checkpoints ontstaan die de ontbrekende trainingstraject benaderen en een geometrische voetafdruk van de trainingsdata in de gewichtsruimte blootleggen. Uit deze gesimuleerde voetafdrukken extraheert WARP geometrische kenmerken en koppelt deze aan domeinproporties, hetzij met een parameterloze softmax-uitlezing, hetzij met een MLP-projector getraind op synthetische mengsels. In gecontroleerde experimenten met BERT en GPT-2 herstelt WARP domeinmengsels met een gemiddelde MAE van respectievelijk slechts 0,046 en 0,104, wat beter presteert dan lidmaatschapsinferentie en een variant met toegang tot de werkelijke trainingstraject.
English
Foundation models are routinely released to the public, yet the data recipes used to train them -- such as domain mixture weights that determine how different sources are sampled -- are rarely disclosed. This creates an access asymmetry: researchers study the resulting models but lack visibility into the training distribution that produces them. Prior works for inferring training data, such as membership inference, detect at the level of individual samples and thus cannot characterize the global composition of the training corpus. We introduce WARP, a framework that recovers a fine-tuned model's training mixtures directly from its released weights. WARP interpolates between the base and fine-tuned models using model merging, generating pseudo-checkpoints that approximate the missing training trajectory and expose a geometric footprint of the training data in the weight space. From these simulated footprints, WARP extracts geometric features and maps them to domain proportions using either a parameter-free softmax readout or an MLP projector trained on synthetic mixtures. In controlled experiments with BERT and GPT-2, WARP recovers domain mixtures with an average MAE as low as 0.046 and 0.104 respectively, outperforming membership inference and a variant with access to the true training trajectory.