Внимание к мультимодальной генерации по одному токену за раз
Attending to Multimodal Generation One Token at a Time
July 4, 2026
Авторы: Varun Gupta, Vineet Gandhi, Makarand Tapaswi
cs.AI
Аннотация
Мультимодальные большие языковые модели (MLLM) генерируют ответы авторегрессивно, интегрируя визуальную и лингвистическую информацию в развивающемся контексте. Предыдущие работы по интерпретируемости были сосредоточены на отдельных слоях и цепях (где), оставляя малоизученной динамику на уровне токенов мультимодальных вычислений во время генерации (когда). Мы устраняем этот пробел и исследуем сдвиги внимания в зависимости от семантической роли, отслеживая внимание модели к изображению, тексту, инструкции и ранее сгенерированным токенам, один токен за раз (OTaT). Мы вводим мультимодальные задачи, требующие явного переключения между визуальным и текстовым контекстом в рамках одного ответа. На двух основных семействах моделей и четырех MLLM с открытыми весами разного размера мы устанавливаем устойчивые закономерности: внимание к изображению достигает пика на токенах, требующих полученной из изображения информации; токены инструкции повторно посещаются во время перехода между задачами; а внимание к ранее сгенерированным токенам возрастает по мере продвижения генерации. Каузальные вмешательства с блокировкой внимания подтверждают функциональную роль этих тенденций. Мы профилируем поведение модели при нарушенном внимании и наблюдаем, как ответы возвращаются к языковым априорам, либо демонстрируют кросс-модальную утечку, отрицание или восстановление. Наконец, руководствуясь нашей новой динамикой внимания, мы предлагаем простое вмешательство во время тестирования для усиления внимания к соответствующей модальности в нужный момент, что значительно улучшает производительность на мультимодальных задачах.
English
Multimodal large language models (MLLMs) generate responses autoregressively, integrating visual and linguistic information in an evolving context. Prior work on interpretability has focused on individual layers and circuits (where), leaving the token-level dynamics of multimodal computation during generation (when) underexplored. We address this gap and study attention shifts as per semantic role; tracking model attention to image, text, instruction, and previously generated tokens, One Token at a Time (OTaT). We introduce multimodal tasks that require explicit switching between visual and textual context within a single response. Across two mainstream model families and four open-weight MLLMs of varying sizes, we establish consistent patterns: attention to image peaks at tokens requiring image-derived information, instruction tokens are revisited during task transitions, and attention to previously generated tokens increases as the generation progresses. Causal attention blocking interventions validate the functional role of these trends. We profile model behavior under disrupted attention and observe responses falling back to language priors, or exhibiting cross-modal leakage, denial, or recovery. Finally, informed of the attention dynamics through our novel analysis, we propose a simple test-time intervention to boost attention to the relevant modality at the right time, significantly improving multimodal task performance.