ChatPaper.aiChatPaper

SynthDocBench: Benchmark Controlado para Compreensão de Documentos Visuais em Contexto Longo

SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding

July 11, 2026
Autores: Abhigya Verma, Khyati Mahajan, Amit Kumar Saha, Shruthan Radhakrishna, Sagar Davasam, Vikas Yadav, Sai Rajeswar Mudumba
cs.AI

Resumo

Modelos de linguagem visual (VLMs) têm alcançado desempenho robusto em benchmarks de compreensão visual de documentos, como DocVQA, ChartQA e MMLongBench-Doc. No entanto, documentos do mundo real combinam múltiplos fatores — como extensão, complexidade de layout, modalidade e dificuldade das perguntas —, o que dificulta atribuir falhas dos modelos a causas específicas. Apresentamos o SynthDocBench, um benchmark totalmente sintético para compreensão visual de documentos em contexto longo, que controla sistematicamente fatores como extensão do documento, estrutura do layout, composição de modalidades e tipo de pergunta. O benchmark é construído mediante um design combinatório, no qual cada fator varia independentemente entre os documentos gerados, permitindo uma análise controlada do comportamento dos modelos. Os documentos são gerados de ponta a ponta por meio de um pipeline de LLM em seis arquétipos de layout, com uma substituição aleatória de 40% para impedir que os modelos explorem correlações espúrias. Além disso, o SynthDocBench abrange documentos de contexto longo com extensão e diversidade estrutural substancialmente maiores do que os benchmarks existentes. Avaliando sete VLMs de ponta, identificamos três modos de falha que os benchmarks atuais não conseguem revelar: degradação acentuada com a extensão do documento, uma sensibilidade posicional sistemática em que o terço médio de um documento é o mais difícil para cinco dos seis modelos — e cinco dos seis modelos apresentam uma tendência negativa do início para o final (declínio mais acentuado: 8,3 pontos percentuais) —, e o colapso da compreensão de gráficos em cenários de documentos longos. Esses resultados sugerem que os modelos atuais podem estar se superajustando a artefatos de benchmark, em vez de alcançar uma compreensão robusta de documentos visuais em contexto longo.
English
Vision language models (VLMs) have achieved strong performance on visual document understanding benchmarks such as DocVQA, ChartQA, and MMLongBench-Doc. However, real-world documents combine multiple factors such as length, layout complexity, modality, and question difficulty, which makes it difficult to attribute model failures to specific causes. We introduce SynthDocBench, a fully synthetic benchmark for long-context visual document understanding that systematically controls factors including document length, layout structure, modality composition, and question type. The benchmark is constructed using a combinatorial design, each factor is varied independently across generated documents, enabling controlled analysis of model behavior. Documents are generated end to end using an LLM pipeline across six layout archetypes, with a 40 percent random override to prevent models from exploiting spurious correlations. Additionally, SynthDocBench spans long-context documents with substantially greater length and structural diversity than existing benchmarks. Evaluating seven frontier VLMs, we uncover three failure modes that existing benchmarks cannot surface: sharp degradation with document length, a systematic positional sensitivity in which the middle third of a document is hardest for five of six models and five of six models show a negative Early-to-Late trend (steepest decline: 8.3 percentage points), and breakdown of chart comprehension in long-document settings. These results suggest that current models may be overfitting to benchmark artifacts rather than achieving robust long-context visual document understanding.