ChatPaper.aiChatPaper

Grid2Matrix : Révéler l'agnosie numérique dans les modèles vision-langage

Grid2Matrix: Revealing Digital Agnosia in Vision-Language Models

April 14, 2026
Auteurs: Yunkai Zhang, Linda Li, Yingxin Cui, Xiyuan Ruan, Zeyu Zheng, Kezhen Chen, Yi Zhang, Diji Yang
cs.AI

Résumé

Les modèles vision-langage (VLM) excellent sur de nombreux benchmarks de raisonnement multimodal, mais ces évaluations ne nécessitent souvent pas une lecture exhaustive de l'image et peuvent ainsi masquer des échecs dans la capture fidèle de tous les détails visuels. Nous présentons Grid2Matrix (G2M), un benchmark contrôlé dans lequel un modèle voit une grille de couleurs et une correspondance couleur-nombre, et doit produire la matrice correspondante. En faisant varier la taille de la grille et le nombre de couleurs, G2M offre un moyen simple d'augmenter la complexité visuelle tout en minimisant les confusions sémantiques. Nous constatons que les VLM présentent un effondrement précoce et marqué en évaluation zero-shot de bout en bout, échouant sur des grilles étonnamment petites plutôt que de se dégrader progressivement à mesure que la tâche devient plus dense. Nous sondons les encodeurs visuels de VLM issus de deux familles représentatives et constatons qu'ils préservent substantiellement plus d'informations de la grille que les sorties de bout en bout correspondantes. Cela suggère que l'échec ne s'explique pas uniquement par l'encodage visuel, mais reflète également un écart entre ce qui reste récupérable depuis les caractéristiques visuelles et ce qui est finalement exprimé en langage. Nous nommons cet écart l'Agnosie Numérique. Des analyses plus poussées montrent que ces erreurs sont hautement structurées et dépendent fortement de la façon dont les cellules de la grille chevauchent les limites des patchs visuels. Nous constatons également que des stratégies courantes telles que la mise à l'échelle des modèles et l'alignement multimodal n'éliminent pas complètement ce mode d'échec. Nous espérons que G2M servira de banc d'essai utile pour comprendre où et comment les VLM perdent les détails visuels fins, et pour évaluer les tâches où manquer de petits détails visuels peut avoir de l'importance, comme les tableaux, les graphiques, les formulaires et les interfaces graphiques.
English
Vision-Language Models (VLMs) excel on many multimodal reasoning benchmarks, but these evaluations often do not require an exhaustive readout of the image and can therefore obscure failures in faithfully capturing all visual details. We introduce Grid2Matrix (G2M), a controlled benchmark in which a model is shown a color grid and a color-to-number mapping, and must output the corresponding matrix. By varying grid size and the number of colors, G2M provides a simple way to increase visual complexity while minimizing semantic confounds. We find that VLMs exhibit a sharp early collapse in zero-shot end-to-end evaluation, failing on surprisingly small grids rather than degrading gradually as the task becomes denser. We probe the visual encoders of VLMs from two representative families and find that they preserve substantially more of the grid information than the corresponding end-to-end outputs. This suggests that the failure is not explained by visual encoding alone, but also reflects a gap between what remains recoverable from visual features and what is ultimately expressed in language. We term this gap Digital Agnosia. Further analyses show that these errors are highly structured and depend strongly on how grid cells overlap with visual patch boundaries. We also find that common strategies such as model scaling and multimodal alignment do not fully eliminate this failure mode. We expect G2M to serve as a useful testbed for understanding where and how VLMs lose fine visual details, and for evaluating tasks where missing even small visual details can matter, such as tables, charts, forms, and GUIs.