Amélioration de la robustesse de la recherche tabulaire par la stabilité représentationnelle
Improving Robustness of Tabular Retrieval via Representational Stability
April 27, 2026
Auteurs: Kushal Raj Bhandari, Adarsh Singh, Jianxi Gao, Soham Dan, Vivek Gupta
cs.AI
Résumé
Les systèmes de récupération de tableaux basés sur Transformer aplatissent les tableaux structurés en séquences de tokens, rendant la récupération sensible au choix de la sérialisation même lorsque la sémantique du tableau reste inchangée. Nous montrons que des sérialisations sémantiquement équivalentes, telles que csv, tsv, html, markdown et ddl, peuvent produire des embeddings et des résultats de récupération substantiellement différents sur plusieurs benchmarks et familles de récupérateurs. Pour remédier à cette instabilité, nous traitons l'embedding de sérialisation comme des vues bruitées d'un signal sémantique partagé et utilisons son centroïde comme représentation cible canonique. Nous montrons que la moyenne des centroïdes supprime la variation spécifique au format et peut restituer le contenu sémantique commun à différentes sérialisations lorsque les décalages induits par le format diffèrent entre les tableaux. Empiriquement, les représentations par centroïde surpassent les formats individuels dans des comparaisons par paires agrégées sur MPNet, BGE-M3, ReasonIR et SPLADE. Nous introduisons en outre un adaptateur à goulot d'étranglement résiduel léger au-dessus d'un encodeur figé qui mappe les embeddings à sérialisation unique vers des cibles centroïdes tout en préservant la variance et en appliquant une régularisation de covariance. L'adaptateur améliore la robustesse pour plusieurs récupérateurs denses, bien que les gains dépendent du modèle et soient plus faibles pour la récupération lexicale éparse. Ces résultats identifient la sensibilité à la sérialisation comme une source majeure de variance dans la récupération et montrent le potentiel de la correction géométrique a posteriori pour une récupération de tableaux invariante à la sérialisation. Notre code, jeux de données et modèles sont disponibles à l'adresse https://github.com/KBhandari11/Centroid-Aligned-Table-Retrieval.
English
Transformer-based table retrieval systems flatten structured tables into token sequences, making retrieval sensitive to the choice of serialization even when table semantics remain unchanged. We show that semantically equivalent serializations, such as csv, tsv, html, markdown, and ddl, can produce substantially different embeddings and retrieval results across multiple benchmarks and retriever families. To address this instability, we treat serialization embedding as noisy views of a shared semantic signal and use its centroid as a canonical target representation. We show that centroid averaging suppresses format-specific variation and can recover the semantic content common to different serializations when format-induced shifts differ across tables. Empirically, centroid representations outrank individual formats in aggregate pairwise comparisons across MPNet, BGE-M3, ReasonIR, and SPLADE. We further introduce a lightweight residual bottleneck adapter on top of a frozen encoder that maps single-serialization embeddings towards centroid targets while preserving variance and enforcing covariance regularization. The adapter improves robustness for several dense retrievers, though gains are model-dependent and weaker for sparse lexical retrieval. These results identify serialization sensitivity as a major source of retrieval variance and show the promise of post hoc geometric correction for serialization-invariant table retrieval. Our code, datasets, and models are available at https://github.com/KBhandari11/Centroid-Aligned-Table-Retrieval{https://github.com/KBhandari11/Centroid-Aligned-Table-Retrieval}.