LLaVA-UHD v4 : Qu'est-ce qui rend l'encodage visuel efficace dans les MLLMs ?
LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?
May 9, 2026
Auteurs: Kechen Fang, Yihua Qin, Chongyi Wang, Wenshuo Ma, Tianyu Yu, Yuan Yao
cs.AI
Résumé
L'encodage visuel constitue un goulot d'étranglement computationnel majeur dans les modèles de langage multimodaux à grande échelle (MLLM), en particulier pour les entrées d'image haute résolution. La pratique courante adopte généralement un encodage global suivi d'une compression post-ViT. L'encodage global produit des séquences massives de tokens, tandis que la compression post-ViT entraîne le coût d'attention quadratique complet du ViT avant toute réduction de tokens. Dans ce travail, nous réexaminons cette convention selon deux dimensions : la stratégie d'encodage et la compression des tokens visuels. Premièrement, des expériences contrôlées montrent que l'encodage par tranches surpasse l'encodage global sur l'ensemble des benchmarks, suggérant que préserver les détails locaux via des vues découpées peut être plus bénéfique que l'application d'une attention globale pour la perception fine. Deuxièmement, nous introduisons une compression précoce intra-ViT, qui réduit les tokens dans les couches superficielles du ViT et diminue considérablement les FLOPs d'encodage visuel tout en préservant les performances en aval. En intégrant la compression intra-ViT dans le cadre d'encodage par tranches, nous présentons LLaVA-UHD v4, un schéma d'encodage visuel efficace et dont la charge de calcul est contrôlable, spécialement conçu pour les entrées haute résolution. Sur un ensemble diversifié de benchmarks couvrant la compréhension de documents, l'OCR et le VQA général, LLaVA-UHD v4 réduit les FLOPs d'encodage visuel de 55,8 % tout en égalant ou dépassant les performances de référence. Ces résultats suggèrent que l'efficacité de l'encodage visuel peut être considérablement améliorée sans sacrifier les performances en aval, offrant une direction de conception pratique pour les MLLM haute résolution efficaces. Tous les poids de modèle et le code seront rendus publics pour soutenir la recherche future.
English
Visual encoding constitutes a major computational bottleneck in Multimodal Large Language Models (MLLMs), especially for high-resolution image inputs. The prevailing practice typically adopts global encoding followed by post-ViT compression. Global encoding produces massive token sequences, while post-ViT compression incurs the full quadratic attention cost of the ViT before any token reduction takes place. In this work, we revisit this convention along two dimensions: the encoding strategy and visual token compression. First, controlled experiments show that slice-based encoding outperforms global encoding across benchmarks, suggesting that preserving local details through sliced views can be more beneficial than applying global attention for fine-grained perception. Second, we introduce intra-ViT early compression, which reduces tokens in shallow ViT layers and substantially lowers visual-encoding FLOPs while preserving downstream performance. By integrating intra-ViT compression into the slice-based encoding framework, we present LLaVA-UHD v4, an efficient and compute-controllable visual encoding scheme tailored for high-resolution inputs. Across a diverse set of benchmarks covering document understanding, OCR, and general VQA, LLaVA-UHD v4 reduces visual-encoding FLOPs by 55.8% while matching or even surpassing baseline performance. These results suggest that visual-encoding efficiency can be substantially improved without sacrificing downstream performance, providing a practical design direction for efficient high-resolution MLLMs. All model weights and code will be publicly released to support further research.