TexOCR : Faire progresser les modèles de reconnaissance optique de documents pour la reconstruction compilable de pages vers LaTeX
TexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX Reconstruction
April 24, 2026
Auteurs: Chengye Wang, Lin Fu, Zexi Kuang, Yilun Zhao
cs.AI
Résumé
L'OCR de documents existant cible principalement le texte brut ou Markdown, abandonnant les propriétés structurelles et exécutables qui rendent LaTeX essentiel pour l'édition scientifique. Nous étudions la reconstruction au niveau de la page des PDF scientifiques en LaTeX compilable et présentons TexOCR-Bench, un benchmark, et TexOCR-Train, un corpus d'entraînement à grande échelle, pour cette tâche. TexOCR-Bench intègre une suite d'évaluation multidimensionnelle qui évalue conjointement la fidélité de la transcription, la justesse structurelle et la capacité de compilation de bout en bout. En tirant parti de TexOCR-Train, nous entraînons un modèle de 2 milliards de paramètres, TexOCR, en utilisant le fine-tuning supervisé (SFT) et l'apprentissage par renforcement (RL) avec des récompenses vérifiables dérivées de tests unitaires LaTeX qui appliquent directement la compilabilité et l'intégrité référentielle. Les expériences menées sur 21 modèles de pointe avec TexOCR-Bench montrent que les systèmes existants violent fréquemment des invariants documentaires clés, incluant la structure cohérente des sections, le placement correct des flottants et les liens valides entre labels et références, ce qui compromet la fiabilité de la compilation et l'utilité en aval. Notre analyse révèle en outre que le RL avec des récompenses vérifiables apporte des améliorations constantes par rapport au SFT seul, particulièrement sur les métriques structurelles et de compilation.
English
Existing document OCR largely targets plain text or Markdown, discarding the structural and executable properties that make LaTeX essential for scientific publishing. We study page-level reconstruction of scientific PDFs into compilable LaTeX and introduce TexOCR-Bench, a benchmark, and TexOCR-Train, a large-scale training corpus, for this task. TexOCR-Bench features a multi-dimensional evaluation suite that jointly assesses transcription fidelity, structural faithfulness, and end-to-end compilability. Leveraging TexOCR-Train, we train a 2B-parameter model, TexOCR, using supervised fine-tuning (SFT) and reinforcement learning (RL) with verifiable rewards derived from LaTeX unit tests that directly enforce compilability and referential integrity. Experiments across 21 frontier models on TexOCR-Bench show that existing systems frequently violate key document invariants, including consistent section structure, correct float placement, and valid label-reference links, which undermines compilation reliability and downstream usability. Our analysis further reveals that RL with verifiable rewards yields consistent improvements over SFT alone, particularly on structural and compilation metrics.