ChatPaper.aiChatPaper

Memória Visual Persistente: Sustentando a Percepção para Geração Profunda em Modelos de Linguagem e Visão de Grande Escala

Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs

May 1, 2026
Autores: Siyuan Huang, Xiaoye Qu, Yafu Li, Tong Zhu, Zefeng He, Muxin Fu, Daizong Liu, Wei-Long Zheng, Yu Cheng
cs.AI

Resumo

Embora os Large Vision-Language Models (LVLMs) autoregressivos demonstrem proficiência notável em tarefas multimodais, eles enfrentam um fenômeno de "Diluição do Sinal Visual", no qual o acúmulo do histórico textual expande a função de partição da atenção, fazendo com que a atenção visual decaia inversamente com o comprimento da sequência gerada. Para neutralizar isso, propomos a Memória Visual Persistente (PVM), um módulo leve e adaptável projetado para garantir uma percepção visual sustentada e sob demanda. Integrado como um ramo paralelo juntamente com a Rede Neural de Alimentação Direta (FFN) nos LVLMs, o PVM estabelece um caminho de recuperação agnóstico à distância que fornece *embeddings* visuais diretamente para uma percepção visual precisa, mitigando assim estruturalmente a supressão de sinal inerente à geração profunda. Experimentos extensivos nos modelos Qwen3-VL demonstram que o PVM traz melhorias notáveis com sobrecarga de parâmetros insignificante, proporcionando ganhos consistentes de precisão média nas escalas de 4B e 8B, particularmente em tarefas de raciocínio complexo que exigem percepção visual persistente. Além disso, uma análise aprofundada revela que o PVM pode resistir ao decaimento do sinal induzido pelo comprimento e acelerar a convergência da previsão interna.
English
While autoregressive Large Vision-Language Models (LVLMs) demonstrate remarkable proficiency in multimodal tasks, they face a "Visual Signal Dilution" phenomenon, where the accumulation of textual history expands the attention partition function, causing visual attention to decay inversely with generated sequence length. To counteract this, we propose Persistent Visual Memory (PVM), a lightweight learnable module designed to ensure sustained, on-demand visual perception. Integrated as a parallel branch alongside the Feed-Forward Network (FFN) in LVLMs, PVM establishes a distance-agnostic retrieval pathway that directly provides visual embeddings for precise visual perception, thereby structurally mitigating the signal suppression inherent to deep generation. Extensive experiments on Qwen3-VL models demonstrate that PVM brings notable improvements with negligible parameter overhead, delivering consistent average accuracy gains across both 4B and 8B scales, particularly in complex reasoning tasks that demand persistent visual perception. Furthermore, in-depth analysis reveals that PVM can resist length-induced signal decay and accelerate internal prediction convergence.