ChatPaper.aiChatPaper

Schaalbare visuele voortraining voor taalintelligentie

Scalable Visual Pretraining for Language Intelligence

July 10, 2026
Auteurs: Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen
cs.AI

Samenvatting

De snelle vooruitgang van grote funderingsmodellen wordt voornamelijk gedreven door voortraining op grootschalige tekstcorpora. Veel vormen van kennis worden echter overgebracht via visuele representaties, waarbij figuren, gezetregelde vergelijkingen en paginalay-outs rijke informatie bevatten die niet getrouw of volledig door alleen tekst kan worden vastgelegd. Toch negeren huidige voortrainingsbenaderingen deze visuele aanwijzingen door visueel rijke bronnen, zoals documenten en webpagina's, om te zetten naar platte tekst voor het leren van taalkundige intelligentie. Dit artikel daagt de standaardveronderstelling uit dat taalmodellen moeten worden getraind op tekst-only representaties en toont aan dat visuele voortraining een schaalbare leerder is voor funderingsmodelintelligentie. Hiertoe voeren we een systematische studie uit naar ongesuperviseerde visuele voortrainingsparadigma's die direct gebruikmaken van visuele documenten zonder tektextractie. Over meerdere backbones en benchmarks heen presteert visuele voortraining op dezelfde onderliggende corpora consistent beter dan tekst-only voortraining, en biedt het een efficiënt pad naar schaalbare taalkundige intelligentie.
English
The rapid progress of large foundation models has been driven predominantly by pretraining on large-scale text corpora. However, many forms of knowledge are conveyed through visual representations, where figures, typeset equations, and page layouts carry rich information that cannot be faithfully or completely captured by text alone. Yet current pretraining approaches discard these visual cues by converting visually rich sources, such as documents and web pages, into plain text for learning language intelligence. This paper challenges the default assumption that language models must be trained on text-only representations and shows that Visual Pretraining is a scalable learner for foundation model intelligence. To this end, we conduct a systematic study of unsupervised visual pretraining paradigms that directly leverage visual documents without text extraction. Across multiple backbones and benchmarks, visual pretraining on the same underlying corpora consistently outperforms text-only pretraining, offering an efficient pathway to scalable language intelligence.