SynthDocBench : un benchmark contrôlé pour la compréhension de documents visuels à long contexte
SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding
July 11, 2026
Auteurs: Abhigya Verma, Khyati Mahajan, Amit Kumar Saha, Shruthan Radhakrishna, Sagar Davasam, Vikas Yadav, Sai Rajeswar Mudumba
cs.AI
Résumé
Les modèles de langage visuel (VLM) ont obtenu de bonnes performances sur les benchmarks de compréhension de documents visuels tels que DocVQA, ChartQA et MMLongBench-Doc. Cependant, les documents réels combinent plusieurs facteurs tels que la longueur, la complexité de la mise en page, la modalité et la difficulté des questions, ce qui rend difficile l'attribution des échecs des modèles à des causes spécifiques.
Nous présentons SynthDocBench, un benchmark entièrement synthétique pour la compréhension de documents visuels à long contexte, qui contrôle systématiquement des facteurs incluant la longueur du document, la structure de la mise en page, la composition des modalités et le type de question. Le benchmark est construit à l'aide d'une conception combinatoire, chaque facteur variant indépendamment parmi les documents générés, permettant une analyse contrôlée du comportement des modèles. Les documents sont générés de bout en bout à l'aide d'un pipeline LLM sur six archétypes de mise en page, avec un remplacement aléatoire de 40 % pour empêcher les modèles d'exploiter des corrélations fallacieuses. De plus, SynthDocBench couvre des documents à long contexte avec une longueur et une diversité structurelle nettement supérieures à celles des benchmarks existants.
En évaluant sept VLM de pointe, nous découvrons trois modes d'échec que les benchmarks existants ne peuvent pas révéler : une dégradation marquée avec la longueur du document, une sensibilité positionnelle systématique où le tiers médian d'un document est le plus difficile pour cinq des six modèles et cinq des six modèles présentent une tendance 'early-to-late' négative (déclin le plus marqué : 8,3 points de pourcentage), et une rupture de la compréhension des graphiques dans des contextes de documents longs. Ces résultats suggèrent que les modèles actuels pourraient surajuster les artefacts des benchmarks plutôt que d'atteindre une compréhension robuste des documents visuels à long contexte.
English
Vision language models (VLMs) have achieved strong performance on visual document understanding benchmarks such as DocVQA, ChartQA, and MMLongBench-Doc. However, real-world documents combine multiple factors such as length, layout complexity, modality, and question difficulty, which makes it difficult to attribute model failures to specific causes. We introduce SynthDocBench, a fully synthetic benchmark for long-context visual document understanding that systematically controls factors including document length, layout structure, modality composition, and question type. The benchmark is constructed using a combinatorial design, each factor is varied independently across generated documents, enabling controlled analysis of model behavior. Documents are generated end to end using an LLM pipeline across six layout archetypes, with a 40 percent random override to prevent models from exploiting spurious correlations. Additionally, SynthDocBench spans long-context documents with substantially greater length and structural diversity than existing benchmarks. Evaluating seven frontier VLMs, we uncover three failure modes that existing benchmarks cannot surface: sharp degradation with document length, a systematic positional sensitivity in which the middle third of a document is hardest for five of six models and five of six models show a negative Early-to-Late trend (steepest decline: 8.3 percentage points), and breakdown of chart comprehension in long-document settings. These results suggest that current models may be overfitting to benchmark artifacts rather than achieving robust long-context visual document understanding.