ChatPaper.aiChatPaper

VIABench: Un Benchmark Integral de Video Recopilado de Personas Ciegas para la Asistencia a la Discapacidad Visual

VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

July 16, 2026
Autores: Yunfeng Liu, Yuandong Yang, Jiarui Han, Zhenpeng Huang, Yuqing Tang, Xiangyu Zeng, Gangshan Wu, Limin Wang
cs.AI

Resumen

Las personas con discapacidad visual (PcDV) enfrentan desafíos cotidianos significativos debido al acceso limitado a la información visual. Aunque los modelos de lenguaje grandes multimodales (MLLMs) han logrado resultados impresionantes en tareas generales de visión y lenguaje, su utilidad práctica en la asistencia real para personas ciegas sigue estando en gran medida inexplorada. Para llenar este vacío, presentamos VIABench, un punto de referencia integral de video diseñado específicamente para evaluar MLLMs en escenarios de asistencia a personas con discapacidad visual, utilizando videos en primera persona grabados o compartidos por las propias PcDV. VIABench define tres tareas centrales, cada una orientada a un requisito distinto en la asistencia visual: **Recordatorio proactivo**: evalúa la capacidad del modelo para interpretar el contenido de video en curso mientras anticipa y describe verbalmente de manera proactiva eventos próximos cruciales para la navegación. **Respuesta a preguntas visuales (VQA)**: evalúa la capacidad del modelo para responder preguntas formuladas por el usuario sobre el entorno u objetos dentro del video. **Interacción guiada por visión**: prueba el razonamiento contextual para lograr interacciones intencionales entre el usuario y el entorno. Para garantizar una evaluación sólida y justa, proponemos un riguroso pipeline de evaluación que admite configuraciones tanto en línea (tiempo real) como fuera de línea. Nuestros experimentos demuestran que los MLLMs actuales todavía tienen dificultades para brindar apoyo integral a las PcDV, especialmente en la tarea de recordatorio proactivo, que exige anticipación precisa y capacidad de respuesta en tiempo real. Esperamos que VIABench impulse la investigación futura hacia el desarrollo de MLLMs personalizados para la asistencia en el mundo real, mejorando en última instancia las experiencias de navegación e interacción para las personas con discapacidad visual. El código y los datos se publicarán en https://github.com/MCG-NJU/VIABench.
English
Visually impaired individuals (VIIs) encounter significant daily challenges due to limited access to visual information. Although Multimodal Large Language Models (MLLMs) have achieved impressive results on general vision and language tasks, their practical utility in real-world blind assistance still remains largely underexplored. To fill this gap, we introduce VIABench, a comprehensive video benchmark specifically designed to evaluate MLLMs in Visually Impaired Assistance scenarios using first-person videos recorded or shared by VIIs themselves. VIABench defines three core tasks, each targeting a distinct requirement in visual assistance. Proactive Reminder: Assesses the model's ability to interpret ongoing video content while proactively anticipating and verbally describing upcoming navigation-critical events; Visual Question Answering (VQA): Evaluates the model's capacity to answer user-posed questions about the environment or objects within the video; Vision-Guided Interaction: Tests context-aware reasoning to accomplish intentional interactions between user and environment. To ensure a robust and fair evaluation, we propose a rigorous benchmarking pipeline that supports both online (real-time) and offline settings. Our experiments demonstrate that current MLLMs still struggle to deliver comprehensive support for VIIs, especially in the Proactive Reminder task, which demands accurate anticipation and real-time responsiveness. We hope VIABench will drive future research toward developing customized MLLMs for real-world assistance, ultimately improving navigation and interaction experiences for visually impaired individuals. Code and data will be released at https://github.com/MCG-NJU/VIABench.