ChatPaper.aiChatPaper

TabEmbed: Avaliação e Aprendizado de Representações Vetoriais Generalistas para Compreensão de Dados Tabulares

TabEmbed: Benchmarking and Learning Generalist Embeddings for Tabular Understanding

May 6, 2026
Autores: Minjie Qiang, Mingming Zhang, Xiaoyi Bao, Xing Fu, Yu Cheng, Weiqiang Wang, Zhongqing Wang, Ningtao Wang
cs.AI

Resumo

Os modelos de base estabeleceram representações unificadas para o processamento de linguagem natural, contudo, este paradigma permanece amplamente inexplorado para dados tabulares. Os métodos existentes enfrentam limitações fundamentais: as abordagens baseadas em LLM carecem de saídas vetoriais compatíveis com recuperação, enquanto os modelos de incorporação de texto frequentemente falham em capturar a estrutura tabular e a semântica numérica. Para preencher esta lacuna, introduzimos primeiro o *Tabular Embedding Benchmark* (TabBench), um conjunto abrangente concebido para avaliar a capacidade de compreensão tabular de modelos de incorporação. Em seguida, propomos o TabEmbed, o primeiro modelo de incorporação generalista que unifica a classificação e a recuperação tabular dentro de um espaço de incorporação partilhado. Ao reformular diversas tarefas tabulares como problemas de correspondência semântica, o TabEmbed aproveita a aprendizagem contrastiva em larga escala com mineração de negativos difíceis com consciência do positivo para discernir nuances estruturais e numéricas de granularidade fina. Os resultados experimentais no TabBench demonstram que o TabEmbed supera significativamente os modelos de incorporação de texto state-of-the-art, estabelecendo uma nova referência para a aprendizagem de representação tabular universal. O código e os conjuntos de dados estão publicamente disponíveis em https://github.com/qiangminjie27/TabEmbed e https://huggingface.co/datasets/qiangminjie27/TabBench.
English
Foundation models have established unified representations for natural language processing, yet this paradigm remains largely unexplored for tabular data. Existing methods face fundamental limitations: LLM-based approaches lack retrieval-compatible vector outputs, whereas text embedding models often fail to capture tabular structure and numerical semantics. To bridge this gap, we first introduce the Tabular Embedding Benchmark (TabBench), a comprehensive suite designed to evaluate the tabular understanding capability of embedding models. We then propose TabEmbed, the first generalist embedding model that unifies tabular classification and retrieval within a shared embedding space. By reformulating diverse tabular tasks as semantic matching problems, TabEmbed leverages large-scale contrastive learning with positive-aware hard negative mining to discern fine-grained structural and numerical nuances. Experimental results on TabBench demonstrate that TabEmbed significantly outperforms state-of-the-art text embedding models, establishing a new baseline for universal tabular representation learning. Code and datasets are publicly available at https://github.com/qiangminjie27/TabEmbed and https://huggingface.co/datasets/qiangminjie27/TabBench.