WARP: Análise do Espaço de Pesos para Recuperação de Portfólios de Dados de Treinamento
WARP: Weight-Space Analysis for Recovering Training Data Portfolios
July 2, 2026
Autores: Tzu-Heng Huang, Aditya Goyal, John Cooper, Frederic Sala
cs.AI
Resumo
Modelos fundamentais são rotineiramente disponibilizados ao público, mas as receitas de dados usadas para treiná-los — como os pesos de mistura de domínios que determinam como diferentes fontes são amostradas — raramente são divulgadas. Isso cria uma assimetria de acesso: os pesquisadores estudam os modelos resultantes, mas não têm visibilidade sobre a distribuição de treinamento que os produz. Trabalhos anteriores para inferir dados de treinamento, como a inferência de associação, detectam no nível de amostras individuais e, portanto, não conseguem caracterizar a composição global do corpus de treinamento. Apresentamos o WARP, uma estrutura que recupera as misturas de treinamento de um modelo ajustado diretamente a partir de seus pesos divulgados. O WARP interpola entre o modelo base e o modelo ajustado usando fusão de modelos, gerando pseudo-checkpoints que aproximam a trajetória de treinamento ausente e expõem uma pegada geométrica dos dados de treinamento no espaço de pesos. A partir dessas pegadas simuladas, o WARP extrai características geométricas e as mapeia para proporções de domínio usando uma leitura softmax sem parâmetros ou um projetor MLP treinado em misturas sintéticas. Em experimentos controlados com BERT e GPT-2, o WARP recupera misturas de domínios com um MAE médio tão baixo quanto 0,046 e 0,104 respectivamente, superando a inferência de associação e uma variante com acesso à verdadeira trajetória de treinamento.
English
Foundation models are routinely released to the public, yet the data recipes used to train them -- such as domain mixture weights that determine how different sources are sampled -- are rarely disclosed. This creates an access asymmetry: researchers study the resulting models but lack visibility into the training distribution that produces them. Prior works for inferring training data, such as membership inference, detect at the level of individual samples and thus cannot characterize the global composition of the training corpus. We introduce WARP, a framework that recovers a fine-tuned model's training mixtures directly from its released weights. WARP interpolates between the base and fine-tuned models using model merging, generating pseudo-checkpoints that approximate the missing training trajectory and expose a geometric footprint of the training data in the weight space. From these simulated footprints, WARP extracts geometric features and maps them to domain proportions using either a parameter-free softmax readout or an MLP projector trained on synthetic mixtures. In controlled experiments with BERT and GPT-2, WARP recovers domain mixtures with an average MAE as low as 0.046 and 0.104 respectively, outperforming membership inference and a variant with access to the true training trajectory.