SynthDocBench: Benchmark Controlado para la Comprensión de Documentos Visuales de Contexto Largo

SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding

July 11, 2026
Autores: Abhigya Verma, Khyati Mahajan, Amit Kumar Saha, Shruthan Radhakrishna, Sagar Davasam, Vikas Yadav, Sai Rajeswar Mudumba
cs.AI

Resumen

Los modelos de lenguaje visual (VLMs) han alcanzado un rendimiento sólido en puntos de referencia de comprensión de documentos visuales como DocVQA, ChartQA y MMLongBench-Doc. Sin embargo, los documentos reales combinan múltiples factores como la longitud, la complejidad del diseño, la modalidad y la dificultad de las preguntas, lo que dificulta atribuir fallos del modelo a causas específicas. Presentamos SynthDocBench, un punto de referencia completamente sintético para la comprensión visual de documentos en contexto largo que controla sistemáticamente factores como la longitud del documento, la estructura del diseño, la composición de modalidades y el tipo de pregunta. El punto de referencia se construye mediante un diseño combinatorio, donde cada factor varía de forma independiente en los documentos generados, lo que permite un análisis controlado del comportamiento del modelo. Los documentos se generan de extremo a extremo utilizando un pipeline de LLM en seis arquetipos de diseño, con un 40% de sobrescritura aleatoria para evitar que los modelos exploten correlaciones espurias. Además, SynthDocBench abarca documentos de contexto largo con una longitud y diversidad estructural sustancialmente mayores que los puntos de referencia existentes. Al evaluar siete VLMs de vanguardia, descubrimos tres modos de fallo que los puntos de referencia actuales no pueden revelar: una degradación pronunciada con la longitud del documento, una sensibilidad posicional sistemática en la que el tercio medio del documento resulta más difícil para cinco de seis modelos, y cinco de seis modelos muestran una tendencia negativa temprano-a-tardío (la disminución más pronunciada: 8,3 puntos porcentuales), y un colapso en la comprensión de gráficos en entornos de documentos largos. Estos resultados sugieren que los modelos actuales podrían estar sobreajustándose a artefactos de los puntos de referencia en lugar de lograr una comprensión visual robusta de documentos en contexto largo.
English
Vision language models (VLMs) have achieved strong performance on visual document understanding benchmarks such as DocVQA, ChartQA, and MMLongBench-Doc. However, real-world documents combine multiple factors such as length, layout complexity, modality, and question difficulty, which makes it difficult to attribute model failures to specific causes. We introduce SynthDocBench, a fully synthetic benchmark for long-context visual document understanding that systematically controls factors including document length, layout structure, modality composition, and question type. The benchmark is constructed using a combinatorial design, each factor is varied independently across generated documents, enabling controlled analysis of model behavior. Documents are generated end to end using an LLM pipeline across six layout archetypes, with a 40 percent random override to prevent models from exploiting spurious correlations. Additionally, SynthDocBench spans long-context documents with substantially greater length and structural diversity than existing benchmarks. Evaluating seven frontier VLMs, we uncover three failure modes that existing benchmarks cannot surface: sharp degradation with document length, a systematic positional sensitivity in which the middle third of a document is hardest for five of six models and five of six models show a negative Early-to-Late trend (steepest decline: 8.3 percentage points), and breakdown of chart comprehension in long-document settings. These results suggest that current models may be overfitting to benchmark artifacts rather than achieving robust long-context visual document understanding.
PDF521July 16, 2026