ChatPaper.aiChatPaper

LLaVA-UHD v4: O Que Torna a Codificação Visual Eficiente em MLLMs?

LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?

May 9, 2026
Autores: Kechen Fang, Yihua Qin, Chongyi Wang, Wenshuo Ma, Tianyu Yu, Yuan Yao
cs.AI

Resumo

A codificação visual constitui um grande gargalo computacional em Modelos de Linguagem Grandes Multimodais (MLLMs), especialmente para entradas de imagens de alta resolução. A prática predominante geralmente adota codificação global seguida de compressão pós-ViT. A codificação global produz sequências massivas de tokens, enquanto a compressão pós-ViT incorre no custo total de atenção quadrática do ViT antes que qualquer redução de tokens ocorra. Neste trabalho, revisitamos esta convenção ao longo de duas dimensões: a estratégia de codificação e a compressão de tokens visuais. Primeiro, experimentos controlados mostram que a codificação baseada em fatias supera a codificação global em todos os benchmarks, sugerindo que preservar detalhes locais através de visualizações em fatias pode ser mais benéfico do que aplicar atenção global para percepção de granulação fina. Em segundo lugar, introduzimos a compressão precoce intra-ViT, que reduz tokens em camadas superficiais do ViT e reduz substancialmente os FLOPs de codificação visual, mantendo o desempenho downstream. Ao integrar a compressão intra-ViT no arcabouço de codificação baseada em fatias, apresentamos o LLaVA-UHD v4, um esquema de codificação visual eficiente e computacionalmente controlável, adaptado para entradas de alta resolução. Em um conjunto diversificado de benchmarks cobrindo compreensão de documentos, OCR e VQA geral, o LLaVA-UHD v4 reduz os FLOPs de codificação visual em 55,8%, enquanto iguala ou até supera o desempenho de referência. Esses resultados sugerem que a eficiência da codificação visual pode ser substancialmente melhorada sem sacrificar o desempenho downstream, fornecendo uma direção de design prática para MLLMs eficientes de alta resolução. Todos os pesos do modelo e o código serão disponibilizados publicamente para apoiar pesquisas futuras.
English
Visual encoding constitutes a major computational bottleneck in Multimodal Large Language Models (MLLMs), especially for high-resolution image inputs. The prevailing practice typically adopts global encoding followed by post-ViT compression. Global encoding produces massive token sequences, while post-ViT compression incurs the full quadratic attention cost of the ViT before any token reduction takes place. In this work, we revisit this convention along two dimensions: the encoding strategy and visual token compression. First, controlled experiments show that slice-based encoding outperforms global encoding across benchmarks, suggesting that preserving local details through sliced views can be more beneficial than applying global attention for fine-grained perception. Second, we introduce intra-ViT early compression, which reduces tokens in shallow ViT layers and substantially lowers visual-encoding FLOPs while preserving downstream performance. By integrating intra-ViT compression into the slice-based encoding framework, we present LLaVA-UHD v4, an efficient and compute-controllable visual encoding scheme tailored for high-resolution inputs. Across a diverse set of benchmarks covering document understanding, OCR, and general VQA, LLaVA-UHD v4 reduces visual-encoding FLOPs by 55.8% while matching or even surpassing baseline performance. These results suggest that visual-encoding efficiency can be substantially improved without sacrificing downstream performance, providing a practical design direction for efficient high-resolution MLLMs. All model weights and code will be publicly released to support further research.