PaperFit: Otimização de Diagramação com Visão no Circuito para Documentos Científicos
PaperFit: Vision-in-the-Loop Typesetting Optimization for Scientific Documents
May 11, 2026
Autores: Bihui Yu, Xinglong Xu, Junjie Jiang, Jiabei Cheng, Caijun Jia, Siyuan Li, Conghui He, Jingxuan Wei, Cheng Tan
cs.AI
Resumo
Um manuscrito LaTeX que compila sem erros não está necessariamente pronto para publicação. Os PDFs resultantes frequentemente sofrem de floats mal posicionados, equações transbordando, escalonamento inconsistente de tabelas, linhas viúvas e órfãs e mau balanceamento de páginas, forçando os autores a repetir ciclos de compilar-inspecionar-editar. Ferramentas baseadas em regras são cegas para os visuais renderizados, operando apenas sobre o código-fonte e arquivos de log. LLMs exclusivamente textuais realizam edição de texto em malha aberta, incapazes de prever ou verificar as consequências bidimensionais do layout de suas alterações. Portanto, uma otimização confiável da composição tipográfica requer uma malha fechada visual com verificação após cada edição. Formalizamos esse problema como Otimização Visual de Composição (VTO), a tarefa de transformar um artigo LaTeX compilável em um PDF visualmente polido e em conformidade com o orçamento de páginas por meio de verificação visual iterativa e revisão em nível de código-fonte, e introduzimos uma taxonomia de cinco categorias de defeitos de composição para orientar o diagnóstico. Apresentamos PaperFit, um agente com visão na malha que renderiza páginas iterativamente, diagnostica defeitos e aplica correções restritas. Para avaliar o VTO, construímos PaperFit-Bench com 200 artigos abrangendo 10 modelos de veículos de publicação e 13 tipos de defeito em diferentes níveis de dificuldade. Experimentos extensivos mostram que PaperFit supera todas as linhas de base por uma ampla margem, estabelecendo que preencher a lacuna entre o código-fonte compilável e o PDF pronto para publicação requer otimização com visão na malha e que o VTO constitui um estágio crítico ausente no pipeline de automação de documentos.
English
A LaTeX manuscript that compiles without error is not necessarily publication-ready. The resulting PDFs frequently suffer from misplaced floats, overflowing equations, inconsistent table scaling, widow and orphan lines, and poor page balance, forcing authors into repetitive compile-inspect-edit cycles. Rule-based tools are blind to rendered visuals, operating only on source code and log files. Text-only LLMs perform open-loop text editing, unable to predict or verify the two-dimensional layout consequences of their changes. Reliable typesetting optimization therefore requires a visual closed loop with verification after every edit. We formalize this problem as Visual Typesetting Optimization (VTO), the task of transforming a compilable LaTeX paper into a visually polished, page-budget-compliant PDF through iterative visual verification and source-level revision, and introduce a five-category taxonomy of typesetting defects to guide diagnosis. We present PaperFit, a vision-in-the-loop agent that iteratively renders pages, diagnoses defects, and applies constrained repairs. To benchmark VTO, we construct PaperFit-Bench with 200 papers across 10 venue templates and 13 defect types at different difficulty. Extensive experiments show that PaperFit outperforms all baselines by a large margin, establishing that bridging the gap from compilable source to publication-ready PDF requires vision-in-the-loop optimization and that VTO constitutes a critical missing stage in the document automation pipeline.