MonkeyOCRv2: Визуально-текстовая базовая модель для Document AI
MonkeyOCRv2: A Visual-Text Foundation Model for Document AI
July 13, 2026
Авторы: Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu, Dongliang Luo, Zhiyin Ma, Jiarui Zhang, Xiang Bai
cs.AI
Аннотация
Основные визуальные кодировщики предварительно обучены на естественных изображениях и не могут быть эффективно применены к изображениям документов без адаптации, ориентированной на документы, поскольку плотный текст и мелкие штрихи символов требуют восприятия на уровне символов. Мы представляем MonkeyOCRv2 — модель с предварительным обучением визуального текста для анализа документов. Во-первых, мы создаем MonkeyDoc v2 — насколько нам известно, крупнейший корпус предварительного обучения для изображений документов, содержащий 113 миллионов изображений на 17 языках. Во-вторых, мы предлагаем стратегию предварительного обучения, которая совместно изучает генерацию изображения в текст и реконструкцию документов на уровне пикселей: первое выравнивает визуальные представления с текстовым содержанием, а второе сохраняет штрихи символов и детали макета. Проведены обширные эксперименты на пяти репрезентативных задачах анализа документов, включая распознавание текста, распознавание формул, обнаружение текста, обнаружение подделок документов и сегментацию перекрывающегося текста. Замена исходных кодировщиков на MonkeyOCRv2 последовательно улучшает производительность по всем пяти задачам. Наконец, мы подтверждаем его эффективность в качестве визуального кодировщика мультимодальных больших языковых моделей на более сложных задачах анализа и понимания документов. Будучи замороженным и объединенным с легковесной языковой моделью, он обеспечивает модель анализа документов на 0,7B параметров, которая устанавливает новый открытый передовой показатель на MDPBench — недавнем бенчмарке, охватывающем цифровые и сфотографированные документы на 17 языках, превосходя предыдущий лучший 3B dots.mocr на 2,8% абсолютно при визуальном кодировщике примерно в 11 раз меньше. Замороженный кодировщик также обеспечивает модель понимания документов, которая превосходит аналоги, построенные на CLIP, DINO и SAM, в восьми бенчмарках при одинаковых условиях обучения. Эти результаты показывают, что предварительное обучение визуальных моделей, ориентированное на документы, может служить самостоятельной основой для интеллектуального анализа документов.
English
Mainstream visual encoders are pretrained on natural images and cannot be effectively applied to document images without document-oriented adaptation, as dense text and fine-grained character strokes demand character-level visual perception. We present MonkeyOCRv2, a visual-text pretrained model for document AI. First, we construct MonkeyDoc v2, to our knowledge the largest document-image pretraining corpus, comprising 113 million images spanning 17 languages. Second, we propose a pretraining strategy that jointly learns image-to-text generation and pixel-level document reconstruction: the former aligns visual representations with textual content, while the latter preserves character strokes and layout details. Extensive experiments are conducted on five representative document analysis tasks, including text recognition, formula recognition, text detection, document tampering detection, and overlapping text segmentation. Replacing the original encoders with MonkeyOCRv2 consistently improves performance across all five tasks. Finally, we validate its effectiveness as the vision encoder of multimodal large language models on the more challenging tasks of document parsing and document understanding. Kept frozen and paired with a lightweight language model, it yields a 0.7B document parsing model that sets a new open-source state-of-the-art on MDPBench, a recent benchmark spanning digital-born and photographed documents across 17 languages, surpassing the previous best 3B dots.mocr by 2.8% absolute with a vision encoder roughly 11times smaller. The frozen encoder also powers a document understanding model that outperforms counterparts built on CLIP, DINO, and SAM across eight benchmarks under identical training settings. These results suggest that document-oriented visual pretraining can serve as a foundation for document intelligence in its own right.