Preentrenamiento visual escalable para inteligencia lingüística
Scalable Visual Pretraining for Language Intelligence
July 10, 2026
Autores: Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen
cs.AI
Resumen
El rápido progreso de los grandes modelos fundacionales ha sido impulsado predominantemente por el preentrenamiento en corpus de texto a gran escala. Sin embargo, muchas formas de conocimiento se transmiten a través de representaciones visuales, donde figuras, ecuaciones tipografiadas y diseños de página contienen información rica que no puede ser capturada fiel o completamente solo por el texto. No obstante, los enfoques actuales de preentrenamiento descartan estas señales visuales al convertir fuentes visualmente ricas, como documentos y páginas web, en texto plano para aprender inteligencia lingüística. Este artículo desafía la suposición predeterminada de que los modelos de lenguaje deben entrenarse solo con representaciones textuales y demuestra que el Preentrenamiento Visual es un aprendiz escalable para la inteligencia de modelos fundacionales. Con este fin, realizamos un estudio sistemático de paradigmas de preentrenamiento visual no supervisado que aprovechan directamente documentos visuales sin extracción de texto. A través de múltiples arquitecturas base y puntos de referencia, el preentrenamiento visual en los mismos corpus subyacentes supera consistentemente al preentrenamiento solo con texto, ofreciendo una vía eficiente hacia la inteligencia lingüística escalable.
English
The rapid progress of large foundation models has been driven predominantly by pretraining on large-scale text corpora. However, many forms of knowledge are conveyed through visual representations, where figures, typeset equations, and page layouts carry rich information that cannot be faithfully or completely captured by text alone. Yet current pretraining approaches discard these visual cues by converting visually rich sources, such as documents and web pages, into plain text for learning language intelligence. This paper challenges the default assumption that language models must be trained on text-only representations and shows that Visual Pretraining is a scalable learner for foundation model intelligence. To this end, we conduct a systematic study of unsupervised visual pretraining paradigms that directly leverage visual documents without text extraction. Across multiple backbones and benchmarks, visual pretraining on the same underlying corpora consistently outperforms text-only pretraining, offering an efficient pathway to scalable language intelligence.