VIABench : un benchmark vidéo exhaustif recueilli auprès de personnes aveugles pour l'assistance aux déficients visuels
VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance
July 16, 2026
Auteurs: Yunfeng Liu, Yuandong Yang, Jiarui Han, Zhenpeng Huang, Yuqing Tang, Xiangyu Zeng, Gangshan Wu, Limin Wang
cs.AI
Résumé
Les personnes malvoyantes (PMV) rencontrent des défis quotidiens significatifs en raison d'un accès limité aux informations visuelles. Bien que les modèles de langage multimodaux de grande taille (MLLMs) aient obtenu des résultats impressionnants dans les tâches générales de vision et de langage, leur utilité pratique dans l'assistance réelle aux aveugles reste encore largement sous-explorée. Pour combler cette lacune, nous présentons VIABench, un benchmark vidéo complet spécialement conçu pour évaluer les MLLMs dans des scénarios d'assistance aux personnes malvoyantes, en utilisant des vidéos à la première personne enregistrées ou partagées par les PMV elles-mêmes. VIABench définit trois tâches principales, chacune ciblant un besoin distinct en matière d'assistance visuelle : Rappel proactif : évalue la capacité du modèle à interpréter le contenu vidéo en cours tout en anticipant et en décrivant verbalement de manière proactive les événements critiques à venir pour la navigation ; Réponse à des questions visuelles (VQA) : évalue la capacité du modèle à répondre aux questions posées par l'utilisateur sur l'environnement ou les objets présents dans la vidéo ; Interaction guidée par la vision : teste le raisonnement contextuel pour réaliser des interactions intentionnelles entre l'utilisateur et l'environnement. Pour garantir une évaluation robuste et équitable, nous proposons un pipeline d'évaluation comparative rigoureux qui prend en charge à la fois les contextes en ligne (temps réel) et hors ligne. Nos expériences montrent que les MLLMs actuels peinent encore à fournir un soutien complet aux PMV, en particulier dans la tâche de Rappel proactif, qui exige une anticipation précise et une réactivité en temps réel. Nous espérons que VIABench stimulera les recherches futures vers le développement de MLLMs adaptés à l'assistance réelle, améliorant ainsi les expériences de navigation et d'interaction pour les personnes malvoyantes. Le code et les données seront publiés à l'adresse https://github.com/MCG-NJU/VIABench.
English
Visually impaired individuals (VIIs) encounter significant daily challenges due to limited access to visual information. Although Multimodal Large Language Models (MLLMs) have achieved impressive results on general vision and language tasks, their practical utility in real-world blind assistance still remains largely underexplored. To fill this gap, we introduce VIABench, a comprehensive video benchmark specifically designed to evaluate MLLMs in Visually Impaired Assistance scenarios using first-person videos recorded or shared by VIIs themselves. VIABench defines three core tasks, each targeting a distinct requirement in visual assistance. Proactive Reminder: Assesses the model's ability to interpret ongoing video content while proactively anticipating and verbally describing upcoming navigation-critical events; Visual Question Answering (VQA): Evaluates the model's capacity to answer user-posed questions about the environment or objects within the video; Vision-Guided Interaction: Tests context-aware reasoning to accomplish intentional interactions between user and environment. To ensure a robust and fair evaluation, we propose a rigorous benchmarking pipeline that supports both online (real-time) and offline settings. Our experiments demonstrate that current MLLMs still struggle to deliver comprehensive support for VIIs, especially in the Proactive Reminder task, which demands accurate anticipation and real-time responsiveness. We hope VIABench will drive future research toward developing customized MLLMs for real-world assistance, ultimately improving navigation and interaction experiences for visually impaired individuals. Code and data will be released at https://github.com/MCG-NJU/VIABench.