ChatPaper.aiChatPaper

PaperFit : Optimisation de la composition typographique avec vision dans la boucle pour documents scientifiques

PaperFit: Vision-in-the-Loop Typesetting Optimization for Scientific Documents

May 11, 2026
Auteurs: Bihui Yu, Xinglong Xu, Junjie Jiang, Jiabei Cheng, Caijun Jia, Siyuan Li, Conghui He, Jingxuan Wei, Cheng Tan
cs.AI

Résumé

Un manuscrit LaTeX qui se compile sans erreur n’est pas nécessairement prêt pour la publication. Les PDF qui en résultent souffrent fréquemment de flottants mal placés, d’équations débordantes, d’un dimensionnement incohérent des tableaux, de lignes veuves et orphelines, ainsi que d’un mauvais équilibre des pages, ce qui oblige les auteurs à répéter des cycles de compilation, inspection et correction. Les outils fondés sur des règles sont aveugles au rendu visuel et n’opèrent que sur le code source et les fichiers journaux. Les LLMs textuels effectuent une édition en boucle ouverte, incapables de prédire ou de vérifier les conséquences de leurs modifications sur la mise en page bidimensionnelle. L’optimisation fiable de la composition typographique nécessite donc une boucle visuelle fermée avec une vérification après chaque modification. Nous formalisons ce problème sous le nom d’Optimisation Visuelle de la Composition Typographique (VTO), définie comme la tâche consistant à transformer un article LaTeX compilable en un PDF visuellement poli et respectant le budget de pages, par un processus itératif de vérification visuelle et de révision du code source. Nous introduisons une taxonomie en cinq catégories des défauts de composition pour guider le diagnostic. Nous présentons PaperFit, un agent à vision en boucle qui rend les pages de manière itérative, diagnostique les défauts et applique des corrections contraintes. Pour évaluer la VTO, nous construisons PaperFit-Bench, comprenant 200 articles couvrant 10 gabarits de conférence et 13 types de défauts de difficulté variable. Des expériences approfondies montrent que PaperFit surpasse largement toutes les méthodes de référence, établissant que combler le fossé entre une source compilable et un PDF prêt pour la publication nécessite une optimisation à vision en boucle, et que la VTO constitue une étape critique manquante dans la chaîne d’automatisation documentaire.
English
A LaTeX manuscript that compiles without error is not necessarily publication-ready. The resulting PDFs frequently suffer from misplaced floats, overflowing equations, inconsistent table scaling, widow and orphan lines, and poor page balance, forcing authors into repetitive compile-inspect-edit cycles. Rule-based tools are blind to rendered visuals, operating only on source code and log files. Text-only LLMs perform open-loop text editing, unable to predict or verify the two-dimensional layout consequences of their changes. Reliable typesetting optimization therefore requires a visual closed loop with verification after every edit. We formalize this problem as Visual Typesetting Optimization (VTO), the task of transforming a compilable LaTeX paper into a visually polished, page-budget-compliant PDF through iterative visual verification and source-level revision, and introduce a five-category taxonomy of typesetting defects to guide diagnosis. We present PaperFit, a vision-in-the-loop agent that iteratively renders pages, diagnoses defects, and applies constrained repairs. To benchmark VTO, we construct PaperFit-Bench with 200 papers across 10 venue templates and 13 defect types at different difficulty. Extensive experiments show that PaperFit outperforms all baselines by a large margin, establishing that bridging the gap from compilable source to publication-ready PDF requires vision-in-the-loop optimization and that VTO constitutes a critical missing stage in the document automation pipeline.