Blind-Spots-Bench : Évaluation des angles morts dans les modèles multimodaux
Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models
July 9, 2026
Auteurs: Matteo Santelmo, Xiuying Wei, Israa Fakih, Felix Bauer, Juan Garcia Giraldo, Chengkun Li, Etienne Bamas, Emmanuel Abbé
cs.AI
Résumé
Les modèles d'IA modernes atteignent des performances élevées sur de nombreux référentiels établis, mais ils échouent encore sur des tâches que les humains considèrent comme presque triviales, telles que manipuler une corde ou dessiner un chien à cinq pattes. Ces exemples suggèrent que les référentiels existants pourraient sous-mesurer les angles morts persistants dans les systèmes actuels. Nous introduisons blind-spots-bench, un référentiel conçu pour exposer ces angles morts à travers des tâches qui paraissent simples pour les humains mais restent difficiles pour l'IA moderne. Nous recueillons des questions brutes d'étudiants dans un cours d'IA, les nettoyons et les annotons avec des solutions de référence structurées, et proposons une taxonomie des tâches adaptée à l'ensemble de données résultant de 235 échantillons. Nous développons en outre un pipeline de notation automatisé pour évaluer un large éventail de modèles, y compris des modèles de langage à poids ouverts et à sources fermées, des modèles vision-langage et des modèles de génération d'images. Notre analyse sur blind-spots-bench révèle que les modèles de pointe à sources fermées peuvent surpasser sensiblement les modèles à poids ouverts, avec un écart d'environ 10 %, même lorsqu'ils atteignent des performances comparables sur les référentiels existants. Une analyse plus fine montre qu'aucun modèle unique ne domine tous les types de tâches et que certaines tâches restent difficiles pour tous les modèles évalués. Ces résultats soulignent la valeur de blind-spots-bench en tant que test de stress diagnostique pour identifier les faiblesses concrètes des modèles modernes actuels.
English
Modern AI models achieve strong performance on many established benchmarks, yet they still fail on tasks that humans find almost trivial, such as manipulating a string or drawing a dog with five legs. These examples suggest that existing benchmarks may under-measure persistent blind spots in current systems. We introduce blind-spots-bench, a benchmark designed to expose such blind spots through tasks that appear simple for humans but remain challenging for modern AI. We collect raw questions from students in an AI course, clean and annotate them with structured reference solutions, and propose a task taxonomy tailored to the resulting dataset of 235 samples. We further develop an automated grading pipeline to evaluate a wide range of models, including open-weight and closed-source language, vision-language, and image-generation models. Our analysis on blind-spots-bench reveals that closed-source frontier models can substantially outperform open-weight models with even approx10% gap, even when they attain comparable performance on existing benchmarks. A more fine-grained analysis shows that no single model dominates across all task types, and that some tasks remain challenging for all evaluated models. These results highlight the value of blind-spots-bench as a diagnostic stress test for identifying concrete weaknesses in current modern models.