Rapport technique OvisOCR2
OvisOCR2 Technical Report
July 15, 2026
Auteurs: Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji, Jun-Peng Jiang, Qing-Guo Chen, Jianshan Zhao, En Lin, Haijun Li, Cheng Qin, Zhao Xu, Weihua Luo
cs.AI
Résumé
Nous présentons OvisOCR2, un modèle d'analyse documentaire de 0,8 milliard de paramètres. OvisOCR2 est conçu comme un analyseur de bout en bout : étant donné une image de page de document, il génère une représentation Markdown dans l'ordre de lecture naturel, couvrant le texte, les formules, les tableaux et les zones visuelles. Nous construisons un moteur de données combinant des annotations filtrées de documents réels avec des pages synthétiques dont les images rendues et les cibles Markdown dérivent de la même source HTML. La recette d'entraînement inclut un fine-tuning supervisé, un apprentissage par renforcement sur une branche de 4 milliards de paramètres avec une conception de récompense multi-composante, une distillation sur politique dans le modèle de 0,8 milliard, ainsi qu'une fusion de modèles. Sur OmniDocBench v1.6, OvisOCR2 atteint un score global de pointe de 96,58, plaçant un modèle de bout en bout en tête de ce classement auparavant dominé par les méthodes par pipeline, soulignant ainsi le potentiel de l'analyse documentaire de bout en bout. Sur PureDocBench, OvisOCR2 obtient également le meilleur score Avg3, soit 75,06. Au-delà de ces deux benchmarks publics, nous évaluons OvisOCR2 sur un benchmark interne conçu pour couvrir un ensemble plus large de scénarios de longue traîne et difficiles. OvisOCR2 obtient les meilleures performances globales parmi les méthodes comparées, fournissant ainsi une preuve supplémentaire de sa généralisation et de sa robustesse. OvisOCR2 est disponible sur https://huggingface.co/ATH-MaaS/OvisOCR2.
English
We introduce OvisOCR2, a 0.8B document parsing model. OvisOCR2 is designed as an end-to-end parser: given a document page image, it generates a Markdown representation in natural reading order, covering text, formulas, tables, and visual regions. We build a data engine that combines filtered real-document annotations with synthetic pages whose rendered images and Markdown targets are derived from the same HTML source. The training recipe includes supervised fine-tuning, reinforcement learning on a 4B branch with a multi-component reward design, on-policy distillation into the 0.8B model, and model fusion. On OmniDocBench v1.6, OvisOCR2 achieves a state-of-the-art overall score of 96.58, placing an end-to-end model at the top of this leaderboard previously dominated by pipeline methods and highlighting the potential of end-to-end document parsing. On PureDocBench, OvisOCR2 also achieves the highest Avg3 score of 75.06. Beyond these two public benchmarks, we evaluate OvisOCR2 on an in-house benchmark designed to cover a broader set of long-tail and challenging scenarios. OvisOCR2 obtains the best overall performance among the compared methods, providing further evidence of its generalization and robustness. OvisOCR2 is available at https://huggingface.co/ATH-MaaS/OvisOCR2.