PixelPrune : Réduction adaptative de jetons visuels au niveau des pixels via codage prédictif
PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive Coding
April 1, 2026
Auteurs: Nan Wang, Zhiwei Jin, Chen Chen, Haonan Lu
cs.AI
Résumé
La compréhension de documents et l'interaction avec les interfaces graphiques comptent parmi les applications à plus haute valeur ajoutée des modèles vision-langage (VLM), mais elles imposent une charge de calcul exceptionnellement lourde : le texte fin et les petits éléments d'interface exigent des entrées haute résolution qui produisent des dizaines de milliers de tokens visuels. Nous observons que ce coût est en grande partie superflu — sur les benchmarks de documents et d'interfaces graphiques, seulement 22 à 71 % des patches d'image sont uniques au niveau des pixels, les autres étant des doublons exacts d'un autre patch de la même image. Nous proposons PixelPrune, qui exploite cette redondance au niveau des pixels grâce à une compression basée sur le codage prédictif, en élaguant les patches redondants avant l'encodeur Vision Transformer (ViT). Comme il opère dans l'espace des pixels avant tout calcul neuronal, PixelPrune accélère à la fois l'encodeur ViT et le LLM en aval, couvrant ainsi l'intégralité du pipeline d'inférence. La méthode ne nécessite aucun apprentissage, ne comporte aucun paramètre apprenable, et supporte la compression sans perte de pixels (τ=0) ainsi que la compression avec perte contrôlée (τ>0). Les expériences menées sur trois échelles de modèle et sur des benchmarks de documents et d'interfaces graphiques montrent que PixelPrune maintient une précision de tâche compétitive tout en offrant une accélération de l'inférence jusqu'à 4,2 fois et une accélération de l'entraînement jusqu'à 1,9 fois. Le code est disponible sur https://github.com/OPPO-Mente-Lab/PixelPrune.
English
Document understanding and GUI interaction are among the highest-value applications of Vision-Language Models (VLMs), yet they impose exceptionally heavy computational burden: fine-grained text and small UI elements demand high-resolution inputs that produce tens of thousands of visual tokens. We observe that this cost is largely wasteful -- across document and GUI benchmarks, only 22--71\% of image patches are pixel-unique, the rest being exact duplicates of another patch in the same image. We propose PixelPrune, which exploits this pixel-level redundancy through predictive-coding-based compression, pruning redundant patches before the Vision Transformer (ViT) encoder. Because it operates in pixel space prior to any neural computation, PixelPrune accelerates both the ViT encoder and the downstream LLM, covering the full inference pipeline. The method is training-free, requires no learnable parameters, and supports pixel-lossless compression (τ{=}0) as well as controlled lossy compression (τ{>}0). Experiments across three model scales and document and GUI benchmarks show that PixelPrune maintains competitive task accuracy while delivering up to 4.2times inference speedup and 1.9times training acceleration. Code is available at https://github.com/OPPO-Mente-Lab/PixelPrune.