Limpeza de Dados com Alinhamento Prévio para Modelos de Fundamento Tabulares
Prior-Aligned Data Cleaning for Tabular Foundation Models
April 28, 2026
Autores: Laure Berti-Equille
cs.AI
Resumo
Os Modelos de Base Tabulares (TFMs) alcançam precisão state-of-the-art em cenário de zero-shot em pequenos conjuntos de dados tabulares através de meta-aprendizado sobre processos sintéticos de geração de dados - tornando-os altamente atrativos para profissionais que não podem dispor de grandes corpora anotados. No entanto, o seu mecanismo de aprendizado em contexto assume entradas aproximadamente limpas: valores ausentes, *outliers* e duplicatas nos dados do mundo real criam um desalinhamento de *prior* que degrada simultaneamente a precisão e a calibração de confiança. Corrigir este desalinhamento requer decisões sequenciais sobre operadores de limpeza cujas interações nenhuma regra estática de pré-processamento pode antecipar - um cenário natural para Aprendizado por Reforço (RL). Introduzimos o L2C2, o primeiro *framework* de RL profundo que enquadra a limpeza de dados tabulares como um alinhamento de *prior*: uma política aprendida sequencia operadores para minimizar a diferença distribucional entre a entrada suja e a *prior* sintética do TFM. Seis experimentos em dez conjuntos de dados de referência do OpenML estabelecem: 1) três de sete projetos de recompensa colapsam em estratégias de limpeza triviais degeneradas - a engenharia de recompensa fundamentada é cientificamente não trivial; 2) a nova recompensa TFMAwareReward que propomos seleciona *pipelines* estruturalmente distintos em 4/10 dos conjuntos de dados e alcança maior precisão do TabPFN nesses casos divergentes (média 0,851 vs. 0,843; Wilcoxon p=0,063, n=4) sem nunca ter desempenho inferior; 3) ações de limpeza parametrizadas melhoram a recompensa da melhor *pipeline* encontrada em 9/10 dos conjuntos de dados (Wilcoxon p=0,004); e 4) uma política pré-treinada em um único conjunto de dados de origem supera o treinamento do zero no ponto de verificação de *fine-tuning* de 2.000 etapas em todos os três conjuntos de dados retidos (até +28,8% após o *fine-tuning* completo) demonstrando transferência de conhecimento de alinhamento de *prior* entre conjuntos de dados. Esses achados estabelecem que o alinhamento de *prior* é uma estratégia de preparação de dados fundamentada para a implantação de TFMs em dados tabulares do mundo real.
English
Tabular Foundation Models (TFMs) achieve state-of-the-art zero-shot accuracy on small tabular datasets by meta-learning over synthetic data-generating processes -- making them highly attractive for practitioners who cannot afford large annotated corpora. However, their in-context learning mechanism assumes approximately clean inputs: missing values, outliers, and duplicates in the real-world data create a prior mismatch that degrades both accuracy and confidence calibration simultaneously. Correcting this mismatch requires sequential decisions over cleaning operators whose interactions no static preprocessing rule can anticipate -a natural fit for reinforcement learning~(RL). We introduce L2C2, the first deep RL framework framing tabular data cleaning as prior alignment: a learned policy sequences operators to minimize the distributional gap between dirty input and the TFM's synthetic prior. Six experiments on ten OpenML benchmark datasets establish: 1) three of seven reward designs collapse to degenerate trivial cleaning strategies -- principled reward engineering is scientifically non-trivial; 2) the novel TFMAwareReward reward we propose selects structurally distinct pipelines on 4/10 datasets and achieves higher TabPFN accuracy on those diverging cases (mean 0.851 vs. 0.843; Wilcoxon p=0.063, n=4) while never underperforming; 3) parameterized cleaning actions improve best-found pipeline reward on 9/10 datasets (Wilcoxon p=0.004); and 4) a policy pre-trained on one single source dataset exceeds scratch training at the 2,000-step fine-tuning checkpoint on all three held-out datasets (up to +28.8% after full fine-tuning) demonstrating cross-dataset transfer of prior-alignment knowledge. These findings establish that prior alignment is a principled data preparation strategy for TFM deployment on real-world tabular data.