OvisOCR2 Technischer Bericht
OvisOCR2 Technical Report
July 15, 2026
Autoren: Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji, Jun-Peng Jiang, Qing-Guo Chen, Jianshan Zhao, En Lin, Haijun Li, Cheng Qin, Zhao Xu, Weihua Luo
cs.AI
Zusammenfassung
Wir stellen OvisOCR2 vor, ein Dokumentenparsermodell mit 0,8 Milliarden Parametern. OvisOCR2 ist als End-to-End-Parser konzipiert: Ausgehend von einem Dokumentseitenbild erzeugt es eine Markdown-Darstellung im natürlichen Lesefluss, die Text, Formeln, Tabellen und visuelle Bereiche abdeckt. Wir entwickeln eine Daten-Engine, die gefilterte Annotationen realer Dokumente mit synthetischen Seiten kombiniert, deren gerenderte Bilder und Markdown-Ziele aus derselben HTML-Quelle stammen. Das Trainingsrezept umfasst überwachtes Feintuning, Verstärkungslernen an einem 4B-Zweig mit einem mehrkomponentigen Belohnungsdesign, On-Policy-Destillation in das 0,8B-Modell sowie Modellfusion. Auf OmniDocBench v1.6 erzielt OvisOCR2 einen Gesamt-Spitzenwert von 96,58 und platziert damit ein End-to-End-Modell an der Spitze dieser Rangliste, die zuvor von Pipeline-Methoden dominiert wurde, und unterstreicht das Potenzial der end-to-end-Dokumentenanalyse. Auf PureDocBench erreicht OvisOCR2 ebenfalls den höchsten Avg3-Wert von 75,06. Über diese beiden öffentlichen Benchmarks hinaus evaluieren wir OvisOCR2 auf einem internen Benchmark, der ein breiteres Spektrum an Long-Tail- und herausfordernden Szenarien abdeckt. OvisOCR2 erzielt die beste Gesamtleistung unter den verglichenen Methoden und liefert damit weitere Belege für seine Generalisierung und Robustheit. OvisOCR2 ist verfügbar unter https://huggingface.co/ATH-MaaS/OvisOCR2.
English
We introduce OvisOCR2, a 0.8B document parsing model. OvisOCR2 is designed as an end-to-end parser: given a document page image, it generates a Markdown representation in natural reading order, covering text, formulas, tables, and visual regions. We build a data engine that combines filtered real-document annotations with synthetic pages whose rendered images and Markdown targets are derived from the same HTML source. The training recipe includes supervised fine-tuning, reinforcement learning on a 4B branch with a multi-component reward design, on-policy distillation into the 0.8B model, and model fusion. On OmniDocBench v1.6, OvisOCR2 achieves a state-of-the-art overall score of 96.58, placing an end-to-end model at the top of this leaderboard previously dominated by pipeline methods and highlighting the potential of end-to-end document parsing. On PureDocBench, OvisOCR2 also achieves the highest Avg3 score of 75.06. Beyond these two public benchmarks, we evaluate OvisOCR2 on an in-house benchmark designed to cover a broader set of long-tail and challenging scenarios. OvisOCR2 obtains the best overall performance among the compared methods, providing further evidence of its generalization and robustness. OvisOCR2 is available at https://huggingface.co/ATH-MaaS/OvisOCR2.