ChatPaper.aiChatPaper

PaperFit: Visie-in-de-Lus Opmaakoptimalisatie voor Wetenschappelijke Documenten

PaperFit: Vision-in-the-Loop Typesetting Optimization for Scientific Documents

May 11, 2026
Auteurs: Bihui Yu, Xinglong Xu, Junjie Jiang, Jiabei Cheng, Caijun Jia, Siyuan Li, Conghui He, Jingxuan Wei, Cheng Tan
cs.AI

Samenvatting

Een LaTeX-manuscript dat foutloos compileert, is niet noodzakelijk publicatieklaar. De resulterende PDF's hebben vaak last van verkeerd geplaatste zwevende objecten, overlopende vergelijkingen, inconsistente tabelschaling, weduwe- en weesregels en een slechte paginabalans, wat auteurs dwingt tot herhaalde compileer-inspecteer-bewerk cycli. Op regels gebaseerde tools zijn blind voor gerenderde visuele elementen en werken alleen op broncode en logbestanden. Alleen-tekst LLM's voeren open-lus tekstediting uit, zonder de tweedimensionale lay-outgevolgen van hun wijzigingen te kunnen voorspellen of verifiëren. Betrouwbare zetoptimalisatie vereist daarom een visuele gesloten lus met verificatie na elke bewerking. We formaliseren dit probleem als Visual Typesetting Optimization (VTO), de taak om een compileerbaar LaTeX-artikel om te zetten in een visueel gepolijste, aan het paginabudget voldoende PDF door middel van iteratieve visuele verificatie en revisie op bronniveau, en introduceren een taxonomie van vijf categorieën van zetfouten om de diagnose te begeleiden. We presenteren PaperFit, een vision-in-the-loop agent die iteratief pagina's rendert, defecten diagnosticeert en beperkte reparaties toepast. Om VTO te benchmarken, construeren we PaperFit-Bench met 200 artikelen verspreid over 10 sjablonen van publicatiekanalen en 13 defecttypen met verschillende moeilijkheidsgraden. Uitgebreide experimenten tonen aan dat PaperFit alle basislijnen met een grote marge overtreft, wat aantoont dat het overbruggen van de kloof van compileerbare bron naar publicatieklare PDF optimalisatie met een visuele lus vereist en dat VTO een cruciale ontbrekende fase vormt in de documentautomatiseringspijplijn.
English
A LaTeX manuscript that compiles without error is not necessarily publication-ready. The resulting PDFs frequently suffer from misplaced floats, overflowing equations, inconsistent table scaling, widow and orphan lines, and poor page balance, forcing authors into repetitive compile-inspect-edit cycles. Rule-based tools are blind to rendered visuals, operating only on source code and log files. Text-only LLMs perform open-loop text editing, unable to predict or verify the two-dimensional layout consequences of their changes. Reliable typesetting optimization therefore requires a visual closed loop with verification after every edit. We formalize this problem as Visual Typesetting Optimization (VTO), the task of transforming a compilable LaTeX paper into a visually polished, page-budget-compliant PDF through iterative visual verification and source-level revision, and introduce a five-category taxonomy of typesetting defects to guide diagnosis. We present PaperFit, a vision-in-the-loop agent that iteratively renders pages, diagnoses defects, and applies constrained repairs. To benchmark VTO, we construct PaperFit-Bench with 200 papers across 10 venue templates and 13 defect types at different difficulty. Extensive experiments show that PaperFit outperforms all baselines by a large margin, establishing that bridging the gap from compilable source to publication-ready PDF requires vision-in-the-loop optimization and that VTO constitutes a critical missing stage in the document automation pipeline.