ChatPaper.aiChatPaper

MonkeyOCRv2: Um Modelo Fundacional Visual-Texto para IA de Documentos

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

July 13, 2026
Autores: Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu, Dongliang Luo, Zhiyin Ma, Jiarui Zhang, Xiang Bai
cs.AI

Resumo

Codificadores visuais convencionais são pré-treinados em imagens naturais e não podem ser aplicados efetivamente a imagens de documentos sem uma adaptação orientada a documentos, pois o texto denso e os traços finos de caracteres exigem percepção visual em nível de caractere. Apresentamos o MonkeyOCRv2, um modelo pré-treinado em texto visual para IA de documentos. Primeiro, construímos o MonkeyDoc v2, que é, até onde sabemos, o maior corpus de pré-treinamento de imagens de documentos, compreendendo 113 milhões de imagens em 17 idiomas. Em segundo lugar, propomos uma estratégia de pré-treinamento que aprende conjuntamente a geração de imagem para texto e a reconstrução de documentos em nível de pixel: a primeira alinha as representações visuais com o conteúdo textual, enquanto a última preserva os traços dos caracteres e os detalhes do layout. Experimentos extensivos são realizados em cinco tarefas representativas de análise de documentos, incluindo reconhecimento de texto, reconhecimento de fórmulas, detecção de texto, detecção de adulteração de documentos e segmentação de texto sobreposto. A substituição dos codificadores originais pelo MonkeyOCRv2 melhora consistentemente o desempenho em todas as cinco tarefas. Finalmente, validamos sua eficácia como codificador visual de modelos de linguagem grandes multimodais nas tarefas mais desafiadoras de análise e compreensão de documentos. Mantido congelado e emparelhado com um modelo de linguagem leve, ele produz um modelo de análise de documentos de 0,7B que estabelece um novo estado da arte de código aberto no MDPBench, um benchmark recente que abrange documentos nativos digitais e fotografados em 17 idiomas, superando o melhor anterior de 3B dots.mocr em 2,8% absoluto com um codificador visual aproximadamente 11 vezes menor. O codificador congelado também alimenta um modelo de compreensão de documentos que supera os equivalentes construídos sobre CLIP, DINO e SAM em oito benchmarks, sob configurações de treinamento idênticas. Esses resultados sugerem que o pré-treinamento visual orientado a documentos pode servir como base para a inteligência de documentos por si só.
English
Mainstream visual encoders are pretrained on natural images and cannot be effectively applied to document images without document-oriented adaptation, as dense text and fine-grained character strokes demand character-level visual perception. We present MonkeyOCRv2, a visual-text pretrained model for document AI. First, we construct MonkeyDoc v2, to our knowledge the largest document-image pretraining corpus, comprising 113 million images spanning 17 languages. Second, we propose a pretraining strategy that jointly learns image-to-text generation and pixel-level document reconstruction: the former aligns visual representations with textual content, while the latter preserves character strokes and layout details. Extensive experiments are conducted on five representative document analysis tasks, including text recognition, formula recognition, text detection, document tampering detection, and overlapping text segmentation. Replacing the original encoders with MonkeyOCRv2 consistently improves performance across all five tasks. Finally, we validate its effectiveness as the vision encoder of multimodal large language models on the more challenging tasks of document parsing and document understanding. Kept frozen and paired with a lightweight language model, it yields a 0.7B document parsing model that sets a new open-source state-of-the-art on MDPBench, a recent benchmark spanning digital-born and photographed documents across 17 languages, surpassing the previous best 3B dots.mocr by 2.8% absolute with a vision encoder roughly 11times smaller. The frozen encoder also powers a document understanding model that outperforms counterparts built on CLIP, DINO, and SAM across eight benchmarks under identical training settings. These results suggest that document-oriented visual pretraining can serve as a foundation for document intelligence in its own right.