Além de IID: Quão Gerais São os Modelos de Fundação Tabulares, Realmente?
Beyond IID: How General Are Tabular Foundation Models, Really?
June 29, 2026
Autores: Lennart Purucker, Andrej Tschalzev, Nick Erickson, Gioia Blayer, David Holzmüller, Alan Arazi, Alexander Pfefferle, Mustafa Tajjar, Gaël Varoquaux, Frank Hutter
cs.AI
Resumo
Modelos fundamentais para aprendizado de máquina preditivo em dados tabulares têm ganhado recentemente tração significativa na academia e na indústria. Comunidades de pesquisa em diversas disciplinas estão cada vez mais avaliando modelos fundamentais tabulares em conjuntos de dados e tarefas diversas. No entanto, essas avaliações específicas por tarefa e disciplina permanecem em grande parte inacessíveis aos pesquisadores de modelos, pois o software de referência e os protocolos de avaliação são fragmentados. Como resultado, os pesquisadores de modelos dependem de benchmarks padrão, que são definidos principalmente para tarefas nas quais os modelos fundamentais tabulares já se destacam. Os cenários mais desafiadores são excluídos, limitando o progresso significativo na área ao focar em melhorias marginais em dados IID, em vez de em desafios mais amplos e exigentes.
Para superar isso, apresentamos o BeyondArena, o primeiro benchmark unificado e holístico para dados tabulares que suporta diversos tipos de tarefas (IID, temporal, agrupado), em escalas de tamanho de amostra e dimensionalidade de características, com diversos tipos de características (com texto, com alta cardinalidade) de uma ampla gama de disciplinas. Para permitir um benchmarking unificado além dos benchmarks padrão, apresentamos o Data Foundry, um framework Python e esquema de metadados para curadoria de conjuntos de dados tabulares para aprendizado de máquina preditivo. Nossos resultados em 11 modelos e 142 conjuntos de dados curados mostram que os modelos fundamentais tabulares existentes se destacam em dados IID de pequeno a médio porte, enquanto modelos tradicionais baseados em árvores e de aprendizado profundo ainda dominam em conjuntos de dados não IID, grandes e de alta dimensionalidade. O BeyondArena orienta a pesquisa de modelos para os desafios mais exigentes em dados tabulares, possibilitando o progresso em direção a modelos tabulares verdadeiramente fundamentais.
English
Foundation models for predictive machine learning on tabular data have recently gained significant traction in academia and industry. Research communities across disciplines are increasingly evaluating tabular foundation models on diverse datasets and tasks. However, these task- and discipline-specific evaluations remain largely inaccessible to model researchers because benchmark software and evaluation protocols are fragmented. As a result, model researchers rely on standard benchmarks, which are mostly defined for tasks where tabular foundation models already excel. The most challenging scenarios are excluded, limiting meaningful progress in the field by focusing on marginal improvements on IID data rather than on broader, more demanding challenges. To overcome this, we introduce BeyondArena, the first unified holistic benchmark for tabular data that supports diverse task types (IID, temporal, grouped), across sample size and feature dimensionality scales, with diverse feature types (with text, with high cardinality) from a broad range of disciplines. To enable unified benchmarking beyond standard benchmarks, we introduce Data Foundry, a Python framework and metadata schema for curating tabular datasets for predictive machine learning. Our results across 11 models and 142 curated datasets show that existing tabular foundation models excel on tiny- to medium-sized IID data, while traditional tree-based and deep learning models still dominate on non-IID, large, and high-dimensional datasets. BeyondArena guides model research for the most demanding challenges in tabular data, enabling progress towards truly foundational tabular models.