Zien is niet delen: sommige visie-taalmodellen overschatten de gemeenschappelijke basis in asymmetrische dialoog
Seeing Is Not Sharing: Some Vision-Language Models Overestimate Common Ground in Asymmetric Dialogue
June 30, 2026
Auteurs: Nan Li, Albert Gatt, Massimo Poesio
cs.AI
Samenvatting
In collaboratieve dialoog garandeert gedeelde perceptie geen gedeelde interpretatie. Wederzijds begrip moet via interactie tot stand worden gebracht. Wij onderzoeken of visie-taalmodelen (VLMs) kunnen onderscheiden wat gedeeld zou kunnen worden van wat daadwerkelijk gedeeld is tussen dialoogdeelnemers via grounding. We formuleren dit als een interpretatie-matchingtaak op 13.077 geannoteerde referentie-uitdrukkingen uit HCRC MapTask-dialogen en evalueren VLMs onder systematisch gecontroleerde manipulaties van dialoogcontext en toegang tot kaartinformatie. Onze resultaten tonen aan dat het aanbieden van authentieke kaartafbeeldingen de algehele prestaties verbetert, maar modellen verschuift naar het overmatig voorspellen van afstemming. Tekstuele beschrijvingen van dezelfde kaartinhoud reproduceren deze bias, terwijl niet-informatieve afbeeldingen afstemmingsvoorspellingen volledig onderdrukken, wat aangeeft dat de bias wordt gedreven door taakrelevante kaartinhoud, niet door het visuele kanaal. Deze verbetering gaat ten koste van verminderde nauwkeurigheid op niet-afgestemde gevallen. Kalibratieanalyse en referentieketen-tracking suggereren verder dat modellen vertrouwen op statische referentiële aanwijzingen op de kaarten in plaats van te volgen hoe grounding zich ontvouwt via de dialooggeschiedenis. Wij observeren deze patronen het duidelijkst in Qwen3-VL-8B-Instruct en, in wisselende mate, in vier extra modellen uit twee architectuurfamilies. In modellen die de bias vertonen, wordt kaartinhoud, zowel visueel als tekstueel gepresenteerd, behandeld als bewijs van wederzijds begrip, waarbij potentieel wordt verward met gevestigd gemeenschappelijk begrip.
English
In collaborative dialogue, shared perception does not guarantee shared interpretation. Mutual understanding must be established through interaction. We investigate whether vision-language models (VLMs) can distinguish what could be shared from what has been shared between dialogue participants through grounding. We formulate this as an interpretation-matching task on 13,077 annotated reference expressions from HCRC MapTask dialogues, and evaluate VLMs under systematically controlled manipulations of dialogue context and map-information access. Our results show that providing authentic map images improves overall performance but shifts models toward over-predicting alignment. Textual descriptions of the same map content reproduce this bias, while non-informative images suppress alignment predictions entirely, indicating that the bias is driven by task-relevant map content, not the visual channel. This improvement comes at the cost of degraded accuracy on non-aligned cases. Calibration analysis and reference-chain tracking further suggest that models rely on static referential cues on the maps rather than tracking how grounding unfolds through dialogue history. We observe these patterns most clearly in Qwen3-VL-8B-Instruct and, to varying degrees, in four additional models from two architecture families. In models that exhibit the bias, map content, whether presented visually or textually, is treated as evidence of mutual understanding, conflating potential with established common ground.