MonkeyOCRv2 : un modèle fondamental visuel-texte pour l'IA documentaire
MonkeyOCRv2: A Visual-Text Foundation Model for Document AI
July 13, 2026
Auteurs: Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu, Dongliang Luo, Zhiyin Ma, Jiarui Zhang, Xiang Bai
cs.AI
Résumé
Les encodeurs visuels classiques sont pré-entraînés sur des images naturelles et ne peuvent être efficacement appliqués aux images de documents sans une adaptation orientée documents, car le texte dense et les traits de caractères fins exigent une perception visuelle au niveau des caractères. Nous présentons MonkeyOCRv2, un modèle pré-entraîné visuel-texte pour l'IA documentaire. Premièrement, nous construisons MonkeyDoc v2, à notre connaissance le plus grand corpus de pré-entraînement d'images de documents, comprenant 113 millions d'images couvrant 17 langues. Deuxièmement, nous proposons une stratégie de pré-entraînement qui apprend conjointement la génération image-texte et la reconstruction de documents au niveau des pixels : la première aligne les représentations visuelles avec le contenu textuel, tandis que la seconde préserve les traits de caractères et les détails de mise en page. Des expériences approfondies sont menées sur cinq tâches représentatives d'analyse de documents, notamment la reconnaissance de texte, la reconnaissance de formules, la détection de texte, la détection de falsification de documents et la segmentation de texte superposé. Remplacer les encodeurs originaux par MonkeyOCRv2 améliore systématiquement les performances sur l'ensemble des cinq tâches. Enfin, nous validons son efficacité en tant qu'encodeur visuel de grands modèles de langage multimodaux sur les tâches plus difficiles d'analyse et de compréhension de documents. Gardé figé et associé à un modèle de langage léger, il produit un modèle d'analyse de documents de 0,7 milliard de paramètres qui établit un nouvel état de l'art open-source sur MDPBench, un benchmark récent couvrant des documents numériques et photographiés dans 17 langues, dépassant le précédent meilleur modèle de 3 milliards de paramètres (dots.mocr) de 2,8 % en valeur absolue, avec un encodeur visuel environ 11 fois plus petit. L'encodeur figé alimente également un modèle de compréhension de documents qui surpasse les homologues construits sur CLIP, DINO et SAM sur huit benchmarks dans des conditions d'entraînement identiques. Ces résultats suggèrent que le pré-entraînement visuel orienté documents peut servir de fondement à part entière pour l'intelligence documentaire.
English
Mainstream visual encoders are pretrained on natural images and cannot be effectively applied to document images without document-oriented adaptation, as dense text and fine-grained character strokes demand character-level visual perception. We present MonkeyOCRv2, a visual-text pretrained model for document AI. First, we construct MonkeyDoc v2, to our knowledge the largest document-image pretraining corpus, comprising 113 million images spanning 17 languages. Second, we propose a pretraining strategy that jointly learns image-to-text generation and pixel-level document reconstruction: the former aligns visual representations with textual content, while the latter preserves character strokes and layout details. Extensive experiments are conducted on five representative document analysis tasks, including text recognition, formula recognition, text detection, document tampering detection, and overlapping text segmentation. Replacing the original encoders with MonkeyOCRv2 consistently improves performance across all five tasks. Finally, we validate its effectiveness as the vision encoder of multimodal large language models on the more challenging tasks of document parsing and document understanding. Kept frozen and paired with a lightweight language model, it yields a 0.7B document parsing model that sets a new open-source state-of-the-art on MDPBench, a recent benchmark spanning digital-born and photographed documents across 17 languages, surpassing the previous best 3B dots.mocr by 2.8% absolute with a vision encoder roughly 11times smaller. The frozen encoder also powers a document understanding model that outperforms counterparts built on CLIP, DINO, and SAM across eight benchmarks under identical training settings. These results suggest that document-oriented visual pretraining can serve as a foundation for document intelligence in its own right.