Blind-Spots-Bench: оценка слепых зон в мультимодальных моделях
Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models
July 9, 2026
Авторы: Matteo Santelmo, Xiuying Wei, Israa Fakih, Felix Bauer, Juan Garcia Giraldo, Chengkun Li, Etienne Bamas, Emmanuel Abbé
cs.AI
Аннотация
Современные модели искусственного интеллекта демонстрируют высокую производительность на многих установленных бенчмарках, однако по-прежнему терпят неудачи в задачах, которые люди считают почти тривиальными, таких как манипуляция строкой или рисование собаки с пятью ногами. Эти примеры позволяют предположить, что существующие бенчмарки могут недооценивать устойчивые слепые зоны в текущих системах. Мы представляем blind-spots-bench — бенчмарк, предназначенный для выявления таких слепых зон с помощью задач, которые кажутся простыми для человека, но остаются сложными для современного ИИ. Мы собираем необработанные вопросы от студентов курса по ИИ, очищаем их и аннотируем структурированными эталонными решениями, а также предлагаем таксономию задач, адаптированную для полученного набора данных из 235 образцов. Далее мы разрабатываем автоматизированный пайплайн оценки для широкого спектра моделей, включая языковые модели с открытыми весами и с закрытым исходным кодом, модели «язык-зрение» и модели генерации изображений. Наш анализ на blind-spots-bench показывает, что закрытые фронтирные модели могут существенно превосходить модели с открытыми весами, с разрывом даже около 10%, даже когда они достигают сопоставимой производительности на существующих бенчмарках. Более детальный анализ демонстрирует, что ни одна модель не доминирует во всех типах задач, а некоторые задачи остаются сложными для всех оцененных моделей. Эти результаты подчеркивают ценность blind-spots-bench как диагностического стресс-теста для выявления конкретных слабых мест в современных моделях.
English
Modern AI models achieve strong performance on many established benchmarks, yet they still fail on tasks that humans find almost trivial, such as manipulating a string or drawing a dog with five legs. These examples suggest that existing benchmarks may under-measure persistent blind spots in current systems. We introduce blind-spots-bench, a benchmark designed to expose such blind spots through tasks that appear simple for humans but remain challenging for modern AI. We collect raw questions from students in an AI course, clean and annotate them with structured reference solutions, and propose a task taxonomy tailored to the resulting dataset of 235 samples. We further develop an automated grading pipeline to evaluate a wide range of models, including open-weight and closed-source language, vision-language, and image-generation models. Our analysis on blind-spots-bench reveals that closed-source frontier models can substantially outperform open-weight models with even approx10% gap, even when they attain comparable performance on existing benchmarks. A more fine-grained analysis shows that no single model dominates across all task types, and that some tasks remain challenging for all evaluated models. These results highlight the value of blind-spots-bench as a diagnostic stress test for identifying concrete weaknesses in current modern models.