ChatPaper.aiChatPaper

MonkeyOCRv2: Een visueel-tekst fundamentmodel voor document-AI

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

July 13, 2026
Auteurs: Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu, Dongliang Luo, Zhiyin Ma, Jiarui Zhang, Xiang Bai
cs.AI

Samenvatting

Mainstream visuele encoders zijn voorgetraind op natuurlijke afbeeldingen en kunnen niet effectief worden toegepast op documentafbeeldingen zonder documentgerichte aanpassing, omdat dichte tekst en fijnkorrelige karakterstrepen visuele perceptie op karakterniveau vereisen. We presenteren MonkeyOCRv2, een visueel-tekstueel voorgetraind model voor document-AI. Ten eerste construeren we MonkeyDoc v2, naar onze weten het grootste voor trainingscorpus voor documentafbeeldingen, bestaande uit 113 miljoen afbeeldingen in 17 talen. Ten tweede stellen we een voor trainingsstrategie voor die gezamenlijk beeld-naar-tekstgeneratie en reconstructie van documenten op pixelniveau leert: de eerste stemt visuele representaties af op tekstuele inhoud, terwijl de tweede karakterstrepen en lay-outdetails behoudt. Uitgebreide experimenten worden uitgevoerd op vijf representatieve documentanalysetaken, waaronder tekstherkenning, formuleherkenning, tekstdetectie, detectie van documentvervalsing en segmentatie van overlappende tekst. Het vervangen van de oorspronkelijke encoders door MonkeyOCRv2 levert consistent verbeteringen op in alle vijf taken. Ten slotte valideren we de effectiviteit ervan als visuele encoder van multimodale grote taalmodellen op de meer uitdagende taken van documentparsing en documentbegrip. In bevroren toestand en gekoppeld aan een lichtgewicht taalmodel levert het een 0,7B documentparsingmodel dat een nieuw open-source state-of-the-art behaalt op MDPBench, een recente benchmark die digitaal geboren en gefotografeerde documenten in 17 talen omvat, en daarbij de vorige beste 3B dots.mocr met 2,8% absoluut overtreft met een visuele encoder die ongeveer 11 keer kleiner is. De bevroren encoder levert ook een documentbegripmodel dat het beter doet dan tegenhangers gebaseerd op CLIP, DINO en SAM op acht benchmarks onder identieke trainingsomstandigheden. Deze resultaten suggereren dat documentgerichte visuele voor training op zichzelf kan dienen als een fundament voor documentintelligentie.
English
Mainstream visual encoders are pretrained on natural images and cannot be effectively applied to document images without document-oriented adaptation, as dense text and fine-grained character strokes demand character-level visual perception. We present MonkeyOCRv2, a visual-text pretrained model for document AI. First, we construct MonkeyDoc v2, to our knowledge the largest document-image pretraining corpus, comprising 113 million images spanning 17 languages. Second, we propose a pretraining strategy that jointly learns image-to-text generation and pixel-level document reconstruction: the former aligns visual representations with textual content, while the latter preserves character strokes and layout details. Extensive experiments are conducted on five representative document analysis tasks, including text recognition, formula recognition, text detection, document tampering detection, and overlapping text segmentation. Replacing the original encoders with MonkeyOCRv2 consistently improves performance across all five tasks. Finally, we validate its effectiveness as the vision encoder of multimodal large language models on the more challenging tasks of document parsing and document understanding. Kept frozen and paired with a lightweight language model, it yields a 0.7B document parsing model that sets a new open-source state-of-the-art on MDPBench, a recent benchmark spanning digital-born and photographed documents across 17 languages, surpassing the previous best 3B dots.mocr by 2.8% absolute with a vision encoder roughly 11times smaller. The frozen encoder also powers a document understanding model that outperforms counterparts built on CLIP, DINO, and SAM across eight benchmarks under identical training settings. These results suggest that document-oriented visual pretraining can serve as a foundation for document intelligence in its own right.