Quando, Onde e Como: Discretização Adaptativa para Aprendizado Auto-Supervisionado em Dados Tabulares
When, Where, and How: Adaptive Binning for Tabular Self-Supervised Learning
June 18, 2026
Autores: Daehwan Kim, Haejun Chung, Ikbeom Jang
cs.AI
Resumo
Dados tabulares médicos são ubíquos na pesquisa clínica, mas o aprendizado profundo para tabelas ainda é pouco explorado, pois rótulos confiáveis frequentemente exigem avaliação especializada custosa, embora variáveis clínicas estruturadas estejam rotineiramente disponíveis em formato tabular. O aprendizado auto-supervisionado pode aproveitar essas tabelas não rotuladas, e pretextos recentes baseados em discretização oferecem um viés indutivo promissor, porém os objetivos existentes fixam uma única discretização global por quantis e aplicam supervisão independente das características. Propomos o Adaptive Binning, um pretexto de discretização adaptável ao treinamento para SSL tabular que acopla a discretização ao aprendizado por meio de um currículo do geral para o específico por característica. Motivado pelo viés espectral das redes neurais e pelos princípios do aprendizado curricular, nosso método refina progressivamente a discretização por característica ao detectar platôs e seleciona divisões conscientes da representação para melhorar conjuntamente a concentração no espaço de valores e a coerência no espaço de representações. Um objetivo ciente da heterogeneidade unifica a reconstrução categórica com supervisão ordinal para características numéricas, e experimentos em conjuntos de dados tabulares médicos públicos sob protocolos de avaliação unificados mostram ganhos consistentes para sondagem linear e ajuste fino, sem ajuste específico da discretização por conjunto de dados. Introduzimos também um benchmark de SSL tabular médico com protocolos padronizados para apoiar o progresso reproduzível nesse domínio pouco explorado. Nosso código está disponível em https://github.com/labhai/Adaptive-Binning.
English
Medical tabular data are ubiquitous in clinical research, but deep learning for tables remains underexplored because reliable labels often require costly expert adjudication, even though structured clinical variables are routinely available in tabular form. Self-supervised learning can leverage these unlabeled tables, and recent binning-based pretexts offer a promising inductive bias, but existing objectives fix a single global quantile discretization and apply feature-agnostic supervision. We propose Adaptive Binning, a training-adaptive discretization pretext for tabular SSL that couples discretization to learning through a feature-wise coarse-to-fine curriculum. Motivated by the spectral bias of neural networks and the principles of curriculum learning, our method progressively refines discretization per feature upon plateau detection and selects representation-aware splits to jointly improve value-space concentration and representation-space coherence. A heterogeneity-aware objective unifies categorical reconstruction with ordinal supervision for numerical features, and experiments on public medical tabular datasets under unified evaluation protocols show consistent gains for linear probing and fine-tuning without dataset-specific discretization tuning. We further introduce a medical tabular SSL benchmark with standardized protocols to support reproducible progress in this underexplored domain. Our code is available at https://github.com/labhai/Adaptive-Binning.