Blind-Spots-Bench: Evaluatie van blinde vlekken in multimodale modellen
Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models
July 9, 2026
Auteurs: Matteo Santelmo, Xiuying Wei, Israa Fakih, Felix Bauer, Juan Garcia Giraldo, Chengkun Li, Etienne Bamas, Emmanuel Abbé
cs.AI
Samenvatting
Moderne AI-modellen presteren goed op veel gevestigde benchmarks, maar falen nog steeds bij taken die mensen vrijwel triviaal vinden, zoals het manipuleren van een string of het tekenen van een hond met vijf poten. Deze voorbeelden suggereren dat bestaande benchmarks mogelijk hardnekkige blinde vlekken in huidige systemen onderschatten. We introduceren blind-spots-bench, een benchmark die is ontworpen om dergelijke blinde vlekken bloot te leggen aan de hand van taken die eenvoudig lijken voor mensen maar uitdagend blijven voor moderne AI. We verzamelen ruwe vragen van studenten in een AI-cursus, schonen deze op en voorzien ze van gestructureerde referentieoplossingen, en stellen een taaltaxonomie voor die is afgestemd op de resulterende dataset van 235 samples. Verder ontwikkelen we een geautomatiseerde beoordelingspijplijn om een breed scala aan modellen te evalueren, waaronder taal-, visie-taal- en beeldgeneratiemodellen met open gewicht en closed-source. Onze analyse op blind-spots-bench laat zien dat closed-source grensverleggende modellen open-gewichtmodellen aanzienlijk kunnen overtreffen, met een verschil van zelfs circa 10%, zelfs wanneer ze vergelijkbare prestaties leveren op bestaande benchmarks. Een fijnmazigere analyse toont aan dat geen enkel model domineert over alle taaktypen, en dat sommige taken uitdagend blijven voor alle geëvalueerde modellen. Deze resultaten benadrukken de waarde van blind-spots-bench als een diagnostische stresstest voor het identificeren van concrete zwaktes in huidige moderne modellen.
English
Modern AI models achieve strong performance on many established benchmarks, yet they still fail on tasks that humans find almost trivial, such as manipulating a string or drawing a dog with five legs. These examples suggest that existing benchmarks may under-measure persistent blind spots in current systems. We introduce blind-spots-bench, a benchmark designed to expose such blind spots through tasks that appear simple for humans but remain challenging for modern AI. We collect raw questions from students in an AI course, clean and annotate them with structured reference solutions, and propose a task taxonomy tailored to the resulting dataset of 235 samples. We further develop an automated grading pipeline to evaluate a wide range of models, including open-weight and closed-source language, vision-language, and image-generation models. Our analysis on blind-spots-bench reveals that closed-source frontier models can substantially outperform open-weight models with even approx10% gap, even when they attain comparable performance on existing benchmarks. A more fine-grained analysis shows that no single model dominates across all task types, and that some tasks remain challenging for all evaluated models. These results highlight the value of blind-spots-bench as a diagnostic stress test for identifying concrete weaknesses in current modern models.