VIABench: всеобъемлющий видеобенчмарк, собранный от слепых людей, для помощи при нарушениях зрения.
VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance
July 16, 2026
Авторы: Yunfeng Liu, Yuandong Yang, Jiarui Han, Zhenpeng Huang, Yuqing Tang, Xiangyu Zeng, Gangshan Wu, Limin Wang
cs.AI
Аннотация
Люди с нарушениями зрения (ЛНЗ) ежедневно сталкиваются с серьёзными трудностями из-за ограниченного доступа к визуальной информации. Хотя мультимодальные большие языковые модели (МБЯМ) достигли впечатляющих результатов в общих задачах на понимание изображений и языка, их практическая применимость в реальной помощи слепым остаётся в значительной степени неизученной. Для заполнения этого пробела мы представляем VIABench — комплексный видеобенчмарк, специально разработанный для оценки МБЯМ в сценариях помощи слабовидящим на основе видеороликов от первого лица, записанных или предоставленных самими ЛНЗ. VIABench определяет три ключевые задачи, каждая из которых нацелена на отдельное требование в визуальной помощи: «Упреждающее напоминание» (Proactive Reminder) — оценивает способность модели интерпретировать текущее видео и одновременно предвосхищать и словесно описывать навигационно-критические события; «Визуальный ответ на вопросы» (Visual Question Answering, VQA) — оценивает способность модели отвечать на задаваемые пользователем вопросы об окружении или объектах на видео; «Взаимодействие, направляемое зрением» (Vision-Guided Interaction) — проверяет контекстно-зависимые рассуждения для осуществления целенаправленных взаимодействий между пользователем и средой. Для обеспечения надёжной и справедливой оценки мы предлагаем строгий конвейер бенчмаркинга, поддерживающий как онлайн-режим (в реальном времени), так и офлайн-режим. Наши эксперименты показывают, что современные МБЯМ всё ещё неспособны обеспечить всестороннюю поддержку ЛНЗ, особенно в задаче «Упреждающее напоминание», которая требует точного предвидения и оперативности в реальном времени. Мы надеемся, что VIABench стимулирует будущие исследования в направлении разработки специализированных МБЯМ для практической помощи, что в конечном итоге улучшит опыт навигации и взаимодействия для людей с нарушениями зрения. Код и данные будут опубликованы по адресу https://github.com/MCG-NJU/VIABench.
English
Visually impaired individuals (VIIs) encounter significant daily challenges due to limited access to visual information. Although Multimodal Large Language Models (MLLMs) have achieved impressive results on general vision and language tasks, their practical utility in real-world blind assistance still remains largely underexplored. To fill this gap, we introduce VIABench, a comprehensive video benchmark specifically designed to evaluate MLLMs in Visually Impaired Assistance scenarios using first-person videos recorded or shared by VIIs themselves. VIABench defines three core tasks, each targeting a distinct requirement in visual assistance. Proactive Reminder: Assesses the model's ability to interpret ongoing video content while proactively anticipating and verbally describing upcoming navigation-critical events; Visual Question Answering (VQA): Evaluates the model's capacity to answer user-posed questions about the environment or objects within the video; Vision-Guided Interaction: Tests context-aware reasoning to accomplish intentional interactions between user and environment. To ensure a robust and fair evaluation, we propose a rigorous benchmarking pipeline that supports both online (real-time) and offline settings. Our experiments demonstrate that current MLLMs still struggle to deliver comprehensive support for VIIs, especially in the Proactive Reminder task, which demands accurate anticipation and real-time responsiveness. We hope VIABench will drive future research toward developing customized MLLMs for real-world assistance, ultimately improving navigation and interaction experiences for visually impaired individuals. Code and data will be released at https://github.com/MCG-NJU/VIABench.