Масштабируемое визуальное предварительное обучение для языкового интеллекта
Scalable Visual Pretraining for Language Intelligence
July 10, 2026
Авторы: Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen
cs.AI
Аннотация
Быстрый прогресс больших фундаментальных моделей в основном обусловлен предварительным обучением на крупномасштабных текстовых корпусах. Однако многие формы знаний передаются через визуальные представления, где рисунки, типографические уравнения и макеты страниц несут богатую информацию, которую невозможно точно или полностью передать только с помощью текста. Тем не менее, современные подходы к предварительному обучению отбрасывают эти визуальные подсказки, преобразуя визуально насыщенные источники, такие как документы и веб-страницы, в обычный текст для изучения языкового интеллекта. В данной статье оспаривается стандартное предположение о том, что языковые модели должны обучаться только на текстовых представлениях, и показывается, что визуальное предварительное обучение является масштабируемым обучаемым для интеллекта фундаментальных моделей. С этой целью мы проводим систематическое исследование парадигм неконтролируемого визуального предварительного обучения, которые напрямую используют визуальные документы без извлечения текста. На различных базовых архитектурах и эталонах визуальное предварительное обучение на одних и тех же базовых корпусах последовательно превосходит предварительное обучение только на тексте, предлагая эффективный путь к масштабируемому языковому интеллекту.
English
The rapid progress of large foundation models has been driven predominantly by pretraining on large-scale text corpora. However, many forms of knowledge are conveyed through visual representations, where figures, typeset equations, and page layouts carry rich information that cannot be faithfully or completely captured by text alone. Yet current pretraining approaches discard these visual cues by converting visually rich sources, such as documents and web pages, into plain text for learning language intelligence. This paper challenges the default assumption that language models must be trained on text-only representations and shows that Visual Pretraining is a scalable learner for foundation model intelligence. To this end, we conduct a systematic study of unsupervised visual pretraining paradigms that directly leverage visual documents without text extraction. Across multiple backbones and benchmarks, visual pretraining on the same underlying corpora consistently outperforms text-only pretraining, offering an efficient pathway to scalable language intelligence.