Pré-entraînement visuel à grande échelle pour l’intelligence du langage
Scalable Visual Pretraining for Language Intelligence
July 10, 2026
Auteurs: Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen
cs.AI
Résumé
Les progrès rapides des grands modèles de fondation ont principalement été portés par le pré-entraînement sur des corpus textuels à grande échelle. Cependant, de nombreuses formes de connaissances sont transmises par des représentations visuelles, où les figures, les équations typographiées et les mises en page contiennent une information riche que le texte seul ne peut restituer fidèlement ou complètement. Pourtant, les approches actuelles de pré-entraînement ignorent ces indices visuels en convertissant des sources visuellement riches, telles que des documents et des pages web, en texte brut pour apprendre l'intelligence langagière. Cet article remet en question l'hypothèse par défaut selon laquelle les modèles de langage doivent être entraînés sur des représentations uniquement textuelles et montre que le pré-entraînement visuel constitue un apprenant scalable pour l'intelligence des modèles de fondation. À cette fin, nous menons une étude systématique des paradigmes de pré-entraînement visuel non supervisé qui exploitent directement les documents visuels sans extraction de texte. Sur plusieurs architectures de base et bancs d'essai, le pré-entraînement visuel sur les mêmes corpus sous-jacents surpasse systématiquement le pré-entraînement uniquement textuel, offrant ainsi une voie efficace vers une intelligence langagière scalable.
English
The rapid progress of large foundation models has been driven predominantly by pretraining on large-scale text corpora. However, many forms of knowledge are conveyed through visual representations, where figures, typeset equations, and page layouts carry rich information that cannot be faithfully or completely captured by text alone. Yet current pretraining approaches discard these visual cues by converting visually rich sources, such as documents and web pages, into plain text for learning language intelligence. This paper challenges the default assumption that language models must be trained on text-only representations and shows that Visual Pretraining is a scalable learner for foundation model intelligence. To this end, we conduct a systematic study of unsupervised visual pretraining paradigms that directly leverage visual documents without text extraction. Across multiple backbones and benchmarks, visual pretraining on the same underlying corpora consistently outperforms text-only pretraining, offering an efficient pathway to scalable language intelligence.