SynthDocBench: Gecontroleerde benchmark voor het begrip van visuele documenten met lange context
SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding
July 11, 2026
Auteurs: Abhigya Verma, Khyati Mahajan, Amit Kumar Saha, Shruthan Radhakrishna, Sagar Davasam, Vikas Yadav, Sai Rajeswar Mudumba
cs.AI
Samenvatting
Visie-taalmodellen (VLMs) hebben sterke prestaties geleverd op benchmarks voor het begrijpen van visuele documenten, zoals DocVQA, ChartQA en MMLongBench-Doc. Echter, documenten uit de praktijk combineren meerdere factoren zoals lengte, lay-outcomplexiteit, modaliteit en vraagmoeilijkheid, wat het moeilijk maakt om modelfouten aan specifieke oorzaken toe te schrijven. We introduceren SynthDocBench, een volledig synthetische benchmark voor het begrijpen van visuele documenten met lange context die systematisch factoren controleert, waaronder documentlengte, lay-outstructuur, modaliteitssamenstelling en vraagtype. De benchmark is geconstrueerd met behulp van een combinatorisch ontwerp; elke factor wordt onafhankelijk gevarieerd over gegenereerde documenten, wat gecontroleerde analyse van modelgedrag mogelijk maakt. Documenten worden end-to-end gegenereerd via een LLM-pijplijn over zes lay-outarchetypen, met een willekeurige overschrijving van 40 procent om te voorkomen dat modellen onechte correlaties exploiteren. Bovendien bestrijkt SynthDocBench documenten met lange context die aanzienlijk grotere lengte en structurele diversiteit hebben dan bestaande benchmarks. Bij het evalueren van zeven geavanceerde VLMs ontdekken we drie faalmodi die bestaande benchmarks niet aan het licht kunnen brengen: scherpe degradatie met documentlengte, een systematische positionele gevoeligheid waarbij het middelste derde deel van een document het moeilijkst is voor vijf van de zes modellen en vijf van de zes modellen een negatieve Early-to-Late-trend vertonen (sterkste daling: 8,3 procentpunt), en instorting van het begrijpen van grafieken in lange-documentomgevingen. Deze resultaten suggereren dat huidige modellen mogelijk overfitten op benchmarkartefacten in plaats van robuust begrip van visuele documenten met lange context te bereiken.
English
Vision language models (VLMs) have achieved strong performance on visual document understanding benchmarks such as DocVQA, ChartQA, and MMLongBench-Doc. However, real-world documents combine multiple factors such as length, layout complexity, modality, and question difficulty, which makes it difficult to attribute model failures to specific causes. We introduce SynthDocBench, a fully synthetic benchmark for long-context visual document understanding that systematically controls factors including document length, layout structure, modality composition, and question type. The benchmark is constructed using a combinatorial design, each factor is varied independently across generated documents, enabling controlled analysis of model behavior. Documents are generated end to end using an LLM pipeline across six layout archetypes, with a 40 percent random override to prevent models from exploiting spurious correlations. Additionally, SynthDocBench spans long-context documents with substantially greater length and structural diversity than existing benchmarks. Evaluating seven frontier VLMs, we uncover three failure modes that existing benchmarks cannot surface: sharp degradation with document length, a systematic positional sensitivity in which the middle third of a document is hardest for five of six models and five of six models show a negative Early-to-Late trend (steepest decline: 8.3 percentage points), and breakdown of chart comprehension in long-document settings. These results suggest that current models may be overfitting to benchmark artifacts rather than achieving robust long-context visual document understanding.