Prêter attention à la génération multimodale un jeton à la fois
Attending to Multimodal Generation One Token at a Time
July 4, 2026
Auteurs: Varun Gupta, Vineet Gandhi, Makarand Tapaswi
cs.AI
Résumé
Les modèles de langage multimodaux de grande taille (MLLMs) génèrent des réponses de manière autorégressive, en intégrant les informations visuelles et linguistiques dans un contexte en évolution. Les travaux antérieurs sur l’interprétabilité se sont concentrés sur les couches individuelles et les circuits (le « où »), laissant la dynamique au niveau des tokens du calcul multimodal pendant la génération (le « quand ») sous-explorée. Nous comblons cette lacune et étudions les déplacements d’attention en fonction du rôle sémantique, en suivant l’attention du modèle envers l’image, le texte, l’instruction et les tokens précédemment générés, un jeton à la fois (One Token at a Time, OTaT). Nous introduisons des tâches multimodales qui nécessitent une alternance explicite entre le contexte visuel et textuel au sein d’une même réponse. À travers deux familles de modèles courantes et quatre MLLMs à poids ouverts de différentes tailles, nous établissons des schémas cohérents : l’attention portée à l’image atteint son maximum pour les tokens nécessitant des informations dérivées de l’image, les tokens d’instruction sont revisités lors des transitions de tâche, et l’attention envers les tokens précédemment générés augmente à mesure que la génération progresse. Des interventions causales de blocage de l’attention valident le rôle fonctionnel de ces tendances. Nous profilons le comportement du modèle sous attention perturbée et observons des réponses qui recourent à des a priori linguistiques, ou présentent des fuites intermodales, des dénis ou des rétablissements. Enfin, éclairés par notre nouvelle analyse des dynamiques d’attention, nous proposons une intervention simple au moment du test pour renforcer l’attention sur la modalité pertinente au bon moment, améliorant significativement les performances des tâches multimodales.
English
Multimodal large language models (MLLMs) generate responses autoregressively, integrating visual and linguistic information in an evolving context. Prior work on interpretability has focused on individual layers and circuits (where), leaving the token-level dynamics of multimodal computation during generation (when) underexplored. We address this gap and study attention shifts as per semantic role; tracking model attention to image, text, instruction, and previously generated tokens, One Token at a Time (OTaT). We introduce multimodal tasks that require explicit switching between visual and textual context within a single response. Across two mainstream model families and four open-weight MLLMs of varying sizes, we establish consistent patterns: attention to image peaks at tokens requiring image-derived information, instruction tokens are revisited during task transitions, and attention to previously generated tokens increases as the generation progresses. Causal attention blocking interventions validate the functional role of these trends. We profile model behavior under disrupted attention and observe responses falling back to language priors, or exhibiting cross-modal leakage, denial, or recovery. Finally, informed of the attention dynamics through our novel analysis, we propose a simple test-time intervention to boost attention to the relevant modality at the right time, significantly improving multimodal task performance.