ChatPaper.aiChatPaper

Blind-Spots-Bench: Evaluación de Puntos Ciegos en Modelos Multimodales

Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models

July 9, 2026
Autores: Matteo Santelmo, Xiuying Wei, Israa Fakih, Felix Bauer, Juan Garcia Giraldo, Chengkun Li, Etienne Bamas, Emmanuel Abbé
cs.AI

Resumen

Los modelos modernos de IA logran un rendimiento elevado en muchos estándares de referencia consolidados, pero aún fallan en tareas que los humanos consideran casi triviales, como manipular una cadena o dibujar un perro con cinco patas. Estos ejemplos sugieren que los puntos de referencia existentes podrían no medir adecuadamente los puntos ciegos persistentes en los sistemas actuales. Presentamos blind-spots-bench, un punto de referencia diseñado para exponer dichos puntos ciegos a través de tareas que parecen simples para los humanos pero siguen siendo un desafío para la IA moderna. Recopilamos preguntas originales de estudiantes en un curso de IA, las limpiamos y anotamos con soluciones de referencia estructuradas, y proponemos una taxonomía de tareas adaptada al conjunto de datos resultante de 235 muestras. Además, desarrollamos un canal de evaluación automatizado para analizar una amplia gama de modelos, incluidos modelos de lenguaje, visión-lenguaje y generación de imágenes, tanto de pesos abiertos como de código cerrado. Nuestro análisis en blind-spots-bench revela que los modelos fronterizos de código cerrado pueden superar sustancialmente a los modelos de pesos abiertos, con una brecha de hasta un ~10 %, incluso cuando obtienen un rendimiento comparable en puntos de referencia existentes. Un análisis más detallado muestra que ningún modelo domina en todos los tipos de tareas, y que algunas tareas siguen siendo un desafío para todos los modelos evaluados. Estos resultados resaltan el valor de blind-spots-bench como una prueba de estrés diagnóstica para identificar debilidades concretas en los modelos modernos actuales.
English
Modern AI models achieve strong performance on many established benchmarks, yet they still fail on tasks that humans find almost trivial, such as manipulating a string or drawing a dog with five legs. These examples suggest that existing benchmarks may under-measure persistent blind spots in current systems. We introduce blind-spots-bench, a benchmark designed to expose such blind spots through tasks that appear simple for humans but remain challenging for modern AI. We collect raw questions from students in an AI course, clean and annotate them with structured reference solutions, and propose a task taxonomy tailored to the resulting dataset of 235 samples. We further develop an automated grading pipeline to evaluate a wide range of models, including open-weight and closed-source language, vision-language, and image-generation models. Our analysis on blind-spots-bench reveals that closed-source frontier models can substantially outperform open-weight models with even approx10% gap, even when they attain comparable performance on existing benchmarks. A more fine-grained analysis shows that no single model dominates across all task types, and that some tasks remain challenging for all evaluated models. These results highlight the value of blind-spots-bench as a diagnostic stress test for identifying concrete weaknesses in current modern models.