STRIDE : Attribution des données d'entraînement via récupération parcimonieuse à partir de perturbations de sous-ensembles
STRIDE: Training Data Attribution via Sparse Recovery from Subset Perturbations
June 3, 2026
Auteurs: Rishit Dagli, Abir Harrasse, Luke Zhang, Florent Draye, Amirali Abdullah, Bernhard Schölkopf, Zhijing Jin
cs.AI
Résumé
L’attribution des données d’entraînement (TDA) vise à relier les prédictions d’un modèle à ses données d’entraînement. La méthode de référence pour la TDA repose sur des interventions causales, consistant à observer comment un modèle change lorsque des données sont ajoutées ou retirées, mais le réentraînement répété est difficile sur le plan computationnel pour les grands modèles de langage (LLMs). Par conséquent, la plupart des approches approximisent cet effet dans l’espace des paramètres à l’aide de gradients. Cependant, suivre les gradients à travers des milliards de paramètres est non seulement excessivement coûteux, mais repose également sur des approximations locales. Dans ce travail, nous proposons un changement de perspective : au lieu d’estimer les changements de paramètres, nous modélisons l’effet fonctionnel des données d’entraînement dans l’espace des activations. Nous introduisons STRIDE (Steering-based Training Data Influence Decomposition), un cadre qui formule la TDA comme un problème de reconstruction parcimonieuse dans l’esprit du compressive sensing. STRIDE apprend des « opérateurs de guidage » légers qui imitent le changement de comportement induit par l’entraînement sur des sous-ensembles de données. En mesurant comment ces opérateurs perturbent les prédictions de test, nous récupérons les influences individuelles des exemples d’entraînement via une décomposition linéaire parcimonieuse. STRIDE atteint l’état de l’art pour l’attribution du pré-entraînement des LLMs tout en étant un ordre de grandeur (13 fois) plus rapide que les travaux précédents. Nous validons également son utilité pratique à travers des applications en aval, notamment la sélection de données, la contamination de données et l’analyse qualitative.
English
Training Data Attribution (TDA) seeks to trace a model's predictions back to its training data. The gold standard for TDA relies on causal interventions, observing how a model changes when data is added or removed, but repeated retraining is computationally challenging for Large Language Models (LLMs). Consequently, most approaches approximate this effect in the parameter space using gradients. However, tracking gradients across billions of parameters is not only prohibitively expensive but relies on local approximations. In this work, we propose a shift: rather than estimating parameter changes, we model the functional effect of training data in the activation space. We introduce STRIDE (Steering-based Training Data Influence Decomposition), a framework that formulates TDA as a sparse recovery problem in the spirit of compressive sensing. STRIDE learns lightweight "steering operators" that mimic the behavioral shift caused by training on data subsets. By measuring how these operators perturb test predictions, we recover individual training example influences via sparse linear decomposition. STRIDE achieves state-of-the-art for LLM pre-training attribution while being an order of magnitude (13times) faster than previous art. We further validate its practical utility through downstream applications including data selection, data contamination, and qualitative analysis.