SynthDocBench: контролируемый эталонный тест для понимания визуальных документов с длинным контекстом
SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding
July 11, 2026
Авторы: Abhigya Verma, Khyati Mahajan, Amit Kumar Saha, Shruthan Radhakrishna, Sagar Davasam, Vikas Yadav, Sai Rajeswar Mudumba
cs.AI
Аннотация
Визуально-языковые модели (VLM) демонстрируют высокую производительность на бенчмарках понимания визуальных документов, таких как DocVQA, ChartQA и MMLongBench-Doc. Однако реальные документы сочетают множество факторов, включая длину, сложность макета, модальность и сложность вопросов, что затрудняет привязку сбоев модели к конкретным причинам. Мы представляем SynthDocBench — полностью синтетический бенчмарк для понимания визуальных документов с длинным контекстом, который систематически контролирует такие факторы, как длина документа, структура макета, модальный состав и тип вопроса. Бенчмарк построен с использованием комбинаторного дизайна: каждый фактор варьируется независимо в сгенерированных документах, что позволяет проводить контролируемый анализ поведения моделей. Документы генерируются сквозным образом с помощью конвейера на основе LLM для шести архитектурных шаблонов макетов, при этом 40% случайных замен предотвращают использование моделями ложных корреляций. Кроме того, SynthDocBench охватывает документы с длинным контекстом, обладающие значительно большей длиной и структурным разнообразием по сравнению с существующими бенчмарками. Оценив семь передовых VLM, мы выявили три режима сбоев, которые существующие бенчмарки не могут обнаружить: резкое ухудшение производительности с увеличением длины документа, систематическую позиционную чувствительность, при которой средняя треть документа оказывается самой сложной для пяти из шести моделей, причем пять из шести моделей демонстрируют отрицательный тренд «от раннего к позднему» (наибольшее снижение: 8,3 процентных пункта), а также нарушение понимания диаграмм в условиях длинных документов. Эти результаты позволяют предположить, что современные модели могут переобучаться на артефактах бенчмарков, а не достигать устойчивого понимания визуальных документов с длинным контекстом.
English
Vision language models (VLMs) have achieved strong performance on visual document understanding benchmarks such as DocVQA, ChartQA, and MMLongBench-Doc. However, real-world documents combine multiple factors such as length, layout complexity, modality, and question difficulty, which makes it difficult to attribute model failures to specific causes. We introduce SynthDocBench, a fully synthetic benchmark for long-context visual document understanding that systematically controls factors including document length, layout structure, modality composition, and question type. The benchmark is constructed using a combinatorial design, each factor is varied independently across generated documents, enabling controlled analysis of model behavior. Documents are generated end to end using an LLM pipeline across six layout archetypes, with a 40 percent random override to prevent models from exploiting spurious correlations. Additionally, SynthDocBench spans long-context documents with substantially greater length and structural diversity than existing benchmarks. Evaluating seven frontier VLMs, we uncover three failure modes that existing benchmarks cannot surface: sharp degradation with document length, a systematic positional sensitivity in which the middle third of a document is hardest for five of six models and five of six models show a negative Early-to-Late trend (steepest decline: 8.3 percentage points), and breakdown of chart comprehension in long-document settings. These results suggest that current models may be overfitting to benchmark artifacts rather than achieving robust long-context visual document understanding.