ChatPaper.aiChatPaper

Atendiendo a la generación multimodal un token a la vez

Attending to Multimodal Generation One Token at a Time

July 4, 2026
Autores: Varun Gupta, Vineet Gandhi, Makarand Tapaswi
cs.AI

Resumen

Los modelos de lenguaje grandes multimodales (MLLMs) generan respuestas de forma autorregresiva, integrando información visual y lingüística en un contexto en evolución. Trabajos previos sobre interpretabilidad se han centrado en capas y circuitos individuales (dónde), dejando sin explorar las dinámicas a nivel de token de la computación multimodal durante la generación (cuándo). Abordamos esta brecha y estudiamos los cambios de atención según el rol semántico; rastreando la atención del modelo hacia la imagen, el texto, la instrucción y los tokens generados previamente, Un Token a la Vez (OTaT). Introducimos tareas multimodales que requieren un cambio explícito entre el contexto visual y textual dentro de una sola respuesta. A través de dos familias de modelos convencionales y cuatro MLLMs de peso abierto de distintos tamaños, establecemos patrones consistentes: la atención a la imagen alcanza su punto máximo en tokens que requieren información derivada de la imagen, los tokens de instrucción son revisitados durante las transiciones de tarea, y la atención a los tokens generados previamente aumenta a medida que avanza la generación. Intervenciones de bloqueo causal de atención validan el rol funcional de estas tendencias. Perfilamos el comportamiento del modelo bajo atención alterada y observamos respuestas que recurren a conocimientos lingüísticos previos, o que presentan fuga intermodal, negación o recuperación. Finalmente, informados de las dinámicas de atención a través de nuestro novedoso análisis, proponemos una intervención simple en tiempo de prueba para aumentar la atención a la modalidad relevante en el momento adecuado, mejorando significativamente el rendimiento en tareas multimodales.
English
Multimodal large language models (MLLMs) generate responses autoregressively, integrating visual and linguistic information in an evolving context. Prior work on interpretability has focused on individual layers and circuits (where), leaving the token-level dynamics of multimodal computation during generation (when) underexplored. We address this gap and study attention shifts as per semantic role; tracking model attention to image, text, instruction, and previously generated tokens, One Token at a Time (OTaT). We introduce multimodal tasks that require explicit switching between visual and textual context within a single response. Across two mainstream model families and four open-weight MLLMs of varying sizes, we establish consistent patterns: attention to image peaks at tokens requiring image-derived information, instruction tokens are revisited during task transitions, and attention to previously generated tokens increases as the generation progresses. Causal attention blocking interventions validate the functional role of these trends. We profile model behavior under disrupted attention and observe responses falling back to language priors, or exhibiting cross-modal leakage, denial, or recovery. Finally, informed of the attention dynamics through our novel analysis, we propose a simple test-time intervention to boost attention to the relevant modality at the right time, significantly improving multimodal task performance.