Relatório Técnico do OvisOCR2
OvisOCR2 Technical Report
July 15, 2026
Autores: Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji, Jun-Peng Jiang, Qing-Guo Chen, Jianshan Zhao, En Lin, Haijun Li, Cheng Qin, Zhao Xu, Weihua Luo
cs.AI
Resumo
Apresentamos o OvisOCR2, um modelo de análise de documentos com 0,8B de parâmetros. O OvisOCR2 é projetado como um analisador ponta a ponta: dada uma imagem de página de documento, ele gera uma representação em Markdown na ordem natural de leitura, abrangendo texto, fórmulas, tabelas e regiões visuais. Construímos um motor de dados que combina anotações filtradas de documentos reais com páginas sintéticas cujas imagens renderizadas e alvos Markdown são derivados da mesma fonte HTML. O esquema de treinamento inclui ajuste fino supervisionado, aprendizado por reforço em um ramo de 4B com um design de recompensa multicomponente, destilação on-policy no modelo de 0,8B e fusão de modelos. No OmniDocBench v1.6, o OvisOCR2 alcança uma pontuação geral de 96,58, estado da arte, colocando um modelo ponta a ponta no topo deste ranking anteriormente dominado por métodos em pipeline e destacando o potencial da análise de documentos ponta a ponta. No PureDocBench, o OvisOCR2 também atinge a maior pontuação Avg3, de 75,06. Além desses dois benchmarks públicos, avaliamos o OvisOCR2 em um benchmark interno projetado para cobrir um conjunto mais amplo de cenários desafiadores e de cauda longa. O OvisOCR2 obtém o melhor desempenho geral entre os métodos comparados, fornecendo evidências adicionais de sua generalização e robustez. O OvisOCR2 está disponível em https://huggingface.co/ATH-MaaS/OvisOCR2.
English
We introduce OvisOCR2, a 0.8B document parsing model. OvisOCR2 is designed as an end-to-end parser: given a document page image, it generates a Markdown representation in natural reading order, covering text, formulas, tables, and visual regions. We build a data engine that combines filtered real-document annotations with synthetic pages whose rendered images and Markdown targets are derived from the same HTML source. The training recipe includes supervised fine-tuning, reinforcement learning on a 4B branch with a multi-component reward design, on-policy distillation into the 0.8B model, and model fusion. On OmniDocBench v1.6, OvisOCR2 achieves a state-of-the-art overall score of 96.58, placing an end-to-end model at the top of this leaderboard previously dominated by pipeline methods and highlighting the potential of end-to-end document parsing. On PureDocBench, OvisOCR2 also achieves the highest Avg3 score of 75.06. Beyond these two public benchmarks, we evaluate OvisOCR2 on an in-house benchmark designed to cover a broader set of long-tail and challenging scenarios. OvisOCR2 obtains the best overall performance among the compared methods, providing further evidence of its generalization and robustness. OvisOCR2 is available at https://huggingface.co/ATH-MaaS/OvisOCR2.