Augmentation Active de Données Tabulaires via l'Inpainting par Diffusion Guidé par une Politique
Active Tabular Augmentation via Policy-Guided Diffusion Inpainting
May 11, 2026
Auteurs: Zheyu Zhang, Shuo Yang, Bardh Prenkaj, Gjergji Kasneci
cs.AI
Résumé
L'augmentation tabulaire générative est attrayante dans les domaines où les données sont rares, mais l'accent prédominant sur la fidélité distributionnelle ne se traduit pas de manière fiable par de meilleurs modèles en aval. Nous formalisons un écart fidélité-utilité : les objectifs génératifs courants privilégient la plausibilité distributionnelle, alors que l'augmentation ne réussit que lorsque les échantillons injectés réduisent la perte d'évaluation sur données exclues de l'apprenant actuel. Cet écart motive l'apprentissage non seulement de la manière de générer, mais aussi de quoi générer et quand injecter au fur et à mesure que l'entraînement progresse. Nous proposons TAP (Tabular Augmentation Policy), qui couple l'inpainting par diffusion avec une politique légère conditionnée par l'apprenant pour orienter la génération vers des régions à haute utilité et contrôler l'injection sécurisée via un portillonnage explicite et un engagement fenêtré conservateur. En situation de grave pénurie de données, TAP surpasse systématiquement les références génératives puissantes sur sept jeux de données réels, améliorant la précision de classification jusqu'à 15,6 points de pourcentage et réduisant l'erreur quadratique moyenne de régression jusqu'à 32 %.
English
Generative tabular augmentation is appealing in data-scarce domains, yet the prevailing focus on distributional fidelity does not reliably translate into better downstream models. We formalize a fidelity-utility gap: common generative objectives prioritize distributional plausibility, whereas augmentation succeeds only when injected samples reduce the current learner's held-out evaluation loss. This gap motivates learning not just how to generate, but what to generate and when to inject as training evolves. We propose TAP (Tabular Augmentation Policy), which couples diffusion inpainting with a lightweight, learner-conditioned policy to steer generation toward high-utility regions and controls safe injection via explicit gating and conservative windowed commitment. Under severe data scarcity, TAP consistently outperforms strong generative baselines on seven real-world datasets, improving classification accuracy by up to 15.6 percentage points and reducing regression RMSE by up to 32%.