Aandacht besteden aan multimodale generatie, één token tegelijk
Attending to Multimodal Generation One Token at a Time
July 4, 2026
Auteurs: Varun Gupta, Vineet Gandhi, Makarand Tapaswi
cs.AI
Samenvatting
Multimodale grote taalmodellen (MLLM's) genereren antwoorden autoregressief, waarbij visuele en taalkundige informatie worden geïntegreerd in een evoluerende context. Eerder werk over interpreteerbaarheid heeft zich gericht op individuele lagen en circuits (waar), waarbij de dynamiek op token-niveau van multimodale berekeningen tijdens generatie (wanneer) onderbelicht blijft. Wij vullen deze leemte aan en bestuderen aandachtsverschuivingen per semantische rol; door de aandacht van het model voor afbeeldingen, tekst, instructies en eerder gegenereerde tokens te volgen, Eén Token per Keer (One Token at a Time, OTaT). Wij introduceren multimodale taken die expliciet schakelen tussen visuele en tekstuele context binnen één enkele respons vereisen. Bij twee gangbare modelfamilies en vier open-weight MLLM's van verschillende grootten stellen we consistente patronen vast: aandacht voor afbeeldingen piekt bij tokens die beeldinformatie nodig hebben, instructietokens worden opnieuw bezocht tijdens taakovergangen, en aandacht voor eerder gegenereerde tokens neemt toe naarmate de generatie vordert. Causale aandachtblokkerende interventies bevestigen de functionele rol van deze trends. Wij profileren modelgedrag onder verstoorde aandacht en observeren antwoorden die terugvallen op taalpriors, of die crossmodale lekkage, ontkenning of herstel vertonen. Ten slotte, geïnformeerd door de aandachtsdynamiek via onze nieuwe analyse, stellen we een eenvoudige testtijdinterventie voor om de aandacht voor de relevante modaliteit op het juiste moment te versterken, wat de prestaties op multimodale taken aanzienlijk verbetert.
English
Multimodal large language models (MLLMs) generate responses autoregressively, integrating visual and linguistic information in an evolving context. Prior work on interpretability has focused on individual layers and circuits (where), leaving the token-level dynamics of multimodal computation during generation (when) underexplored. We address this gap and study attention shifts as per semantic role; tracking model attention to image, text, instruction, and previously generated tokens, One Token at a Time (OTaT). We introduce multimodal tasks that require explicit switching between visual and textual context within a single response. Across two mainstream model families and four open-weight MLLMs of varying sizes, we establish consistent patterns: attention to image peaks at tokens requiring image-derived information, instruction tokens are revisited during task transitions, and attention to previously generated tokens increases as the generation progresses. Causal attention blocking interventions validate the functional role of these trends. We profile model behavior under disrupted attention and observe responses falling back to language priors, or exhibiting cross-modal leakage, denial, or recovery. Finally, informed of the attention dynamics through our novel analysis, we propose a simple test-time intervention to boost attention to the relevant modality at the right time, significantly improving multimodal task performance.