ChatPaper.aiChatPaper

Pré-treinamento Visual Escalável para Inteligência de Linguagem

Scalable Visual Pretraining for Language Intelligence

July 10, 2026
Autores: Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen
cs.AI

Resumo

O rápido progresso dos grandes modelos fundamentais tem sido impulsionado predominantemente pelo pré-treinamento em grandes corpora de texto. No entanto, muitas formas de conhecimento são transmitidas por meio de representações visuais, onde figuras, equações tipografadas e layouts de página carregam informações ricas que não podem ser fielmente ou completamente capturadas apenas pelo texto. Contudo, as abordagens atuais de pré-treinamento descartam esses sinais visuais ao converter fontes visualmente ricas, como documentos e páginas da web, em texto simples para o aprendizado de inteligência linguística. Este artigo desafia a suposição padrão de que modelos de linguagem devem ser treinados exclusivamente em representações textuais e demonstra que o Pré-treinamento Visual é um aprendiz escalável para a inteligência de modelos fundamentais. Para tal, realizamos um estudo sistemático de paradigmas de pré-treinamento visual não supervisionado que utilizam diretamente documentos visuais sem extração de texto. Através de múltiplos backbones e benchmarks, o pré-treinamento visual nos mesmos corpora subjacentes supera consistentemente o pré-treinamento apenas textual, oferecendo um caminho eficiente para a inteligência linguística escalável.
English
The rapid progress of large foundation models has been driven predominantly by pretraining on large-scale text corpora. However, many forms of knowledge are conveyed through visual representations, where figures, typeset equations, and page layouts carry rich information that cannot be faithfully or completely captured by text alone. Yet current pretraining approaches discard these visual cues by converting visually rich sources, such as documents and web pages, into plain text for learning language intelligence. This paper challenges the default assumption that language models must be trained on text-only representations and shows that Visual Pretraining is a scalable learner for foundation model intelligence. To this end, we conduct a systematic study of unsupervised visual pretraining paradigms that directly leverage visual documents without text extraction. Across multiple backbones and benchmarks, visual pretraining on the same underlying corpora consistently outperforms text-only pretraining, offering an efficient pathway to scalable language intelligence.