ChatPaper.aiChatPaper

MonkeyOCRv2: Un modelo fundamental de visión y texto para Document AI

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

July 13, 2026
Autores: Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu, Dongliang Luo, Zhiyin Ma, Jiarui Zhang, Xiang Bai
cs.AI

Resumen

Los codificadores visuales convencionales se preentrenan con imágenes naturales y no pueden aplicarse de manera efectiva a imágenes de documentos sin una adaptación orientada a documentos, ya que el texto denso y los trazos de caracteres de grano fino exigen una percepción visual a nivel de caracteres. Presentamos MonkeyOCRv2, un modelo preentrenado visual-textual para inteligencia artificial de documentos. Primero, construimos MonkeyDoc v2, que, según nuestro conocimiento, es el corpus de preentrenamiento de imágenes de documentos más grande, compuesto por 113 millones de imágenes en 17 idiomas. Segundo, proponemos una estrategia de preentrenamiento que aprende conjuntamente la generación de imagen a texto y la reconstrucción de documentos a nivel de píxel: la primera alinea las representaciones visuales con el contenido textual, mientras que la segunda preserva los trazos de caracteres y los detalles de diseño. Se realizan experimentos exhaustivos en cinco tareas representativas de análisis de documentos, que incluyen reconocimiento de texto, reconocimiento de fórmulas, detección de texto, detección de manipulación de documentos y segmentación de texto superpuesto. Reemplazar los codificadores originales con MonkeyOCRv2 mejora consistentemente el rendimiento en las cinco tareas. Finalmente, validamos su eficacia como codificador visual de modelos de lenguaje multimodal de gran escala en las tareas más desafiantes de análisis y comprensión de documentos. Manteniéndolo congelado y emparejado con un modelo de lenguaje ligero, produce un modelo de análisis de documentos de 0.7B que establece un nuevo estado del arte de código abierto en MDPBench, un punto de referencia reciente que abarca documentos digitales y fotografiados en 17 idiomas, superando al mejor modelo anterior de 3B (dots.mocr) en un 2.8% absoluto, con un codificador visual aproximadamente 11 veces más pequeño. El codificador congelado también potencia un modelo de comprensión de documentos que supera a sus contrapartes basadas en CLIP, DINO y SAM en ocho puntos de referencia bajo condiciones de entrenamiento idénticas. Estos resultados sugieren que el preentrenamiento visual orientado a documentos puede servir como base para la inteligencia documental por derecho propio.
English
Mainstream visual encoders are pretrained on natural images and cannot be effectively applied to document images without document-oriented adaptation, as dense text and fine-grained character strokes demand character-level visual perception. We present MonkeyOCRv2, a visual-text pretrained model for document AI. First, we construct MonkeyDoc v2, to our knowledge the largest document-image pretraining corpus, comprising 113 million images spanning 17 languages. Second, we propose a pretraining strategy that jointly learns image-to-text generation and pixel-level document reconstruction: the former aligns visual representations with textual content, while the latter preserves character strokes and layout details. Extensive experiments are conducted on five representative document analysis tasks, including text recognition, formula recognition, text detection, document tampering detection, and overlapping text segmentation. Replacing the original encoders with MonkeyOCRv2 consistently improves performance across all five tasks. Finally, we validate its effectiveness as the vision encoder of multimodal large language models on the more challenging tasks of document parsing and document understanding. Kept frozen and paired with a lightweight language model, it yields a 0.7B document parsing model that sets a new open-source state-of-the-art on MDPBench, a recent benchmark spanning digital-born and photographed documents across 17 languages, surpassing the previous best 3B dots.mocr by 2.8% absolute with a vision encoder roughly 11times smaller. The frozen encoder also powers a document understanding model that outperforms counterparts built on CLIP, DINO, and SAM across eight benchmarks under identical training settings. These results suggest that document-oriented visual pretraining can serve as a foundation for document intelligence in its own right.