ChatPaper.aiChatPaper

VIABench: Een uitgebreide videobenchmark verzameld van blinde individuen voor ondersteuning bij visuele beperking

VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

July 16, 2026
Auteurs: Yunfeng Liu, Yuandong Yang, Jiarui Han, Zhenpeng Huang, Yuqing Tang, Xiangyu Zeng, Gangshan Wu, Limin Wang
cs.AI

Samenvatting

Visueel beperkte individuen (VBI's) ervaren dagelijks aanzienlijke uitdagingen door beperkte toegang tot visuele informatie. Hoewel multimodale grote taalmodellen (MGTM's) indrukwekkende resultaten hebben behaald op algemene visuele en taaltaken, blijft hun praktische bruikbaarheid in realistische blindenhulp nog grotendeels onderbelicht. Om deze leemte op te vullen introduceren wij VIABench, een uitgebreide videobenchmark die specifiek is ontworpen om MGTM's te evalueren in scenario's voor ondersteuning van visueel beperkten, gebruikmakend van first-person video's die door VBI's zelf zijn opgenomen of gedeeld. VIABench definieert drie kerntaken, elk gericht op een specifieke behoefte in visuele ondersteuning. Proactieve Herinnering: Beoordeelt het vermogen van het model om doorlopende video-inhoud te interpreteren terwijl het proactief anticipeert op en verbaal beschrijft van aankomende navigatiekritische gebeurtenissen; Visuele Vraagbeantwoording (VQA): Evalueert het vermogen van het model om door gebruikers gestelde vragen over de omgeving of objecten in de video te beantwoorden; Visiegestuurde Interactie: Test contextbewust redeneren om intentionele interacties tussen gebruiker en omgeving te realiseren. Om een robuuste en eerlijke evaluatie te waarborgen, stellen wij een rigoureuze benchmarkpijplijn voor die zowel online (real-time) als offline instellingen ondersteunt. Onze experimenten tonen aan dat huidige MGTM's nog steeds moeite hebben met het bieden van uitgebreide ondersteuning aan VBI's, met name bij de taak Proactieve Herinnering, die nauwkeurige anticipatie en real-time responsiviteit vereist. Wij hopen dat VIABench toekomstig onderzoek zal stimuleren naar de ontwikkeling van aangepaste MGTM's voor praktische ondersteuning, wat uiteindelijk de navigatie- en interactie-ervaringen voor visueel beperkte individuen zal verbeteren. Code en gegevens worden vrijgegeven op https://github.com/MCG-NJU/VIABench.
English
Visually impaired individuals (VIIs) encounter significant daily challenges due to limited access to visual information. Although Multimodal Large Language Models (MLLMs) have achieved impressive results on general vision and language tasks, their practical utility in real-world blind assistance still remains largely underexplored. To fill this gap, we introduce VIABench, a comprehensive video benchmark specifically designed to evaluate MLLMs in Visually Impaired Assistance scenarios using first-person videos recorded or shared by VIIs themselves. VIABench defines three core tasks, each targeting a distinct requirement in visual assistance. Proactive Reminder: Assesses the model's ability to interpret ongoing video content while proactively anticipating and verbally describing upcoming navigation-critical events; Visual Question Answering (VQA): Evaluates the model's capacity to answer user-posed questions about the environment or objects within the video; Vision-Guided Interaction: Tests context-aware reasoning to accomplish intentional interactions between user and environment. To ensure a robust and fair evaluation, we propose a rigorous benchmarking pipeline that supports both online (real-time) and offline settings. Our experiments demonstrate that current MLLMs still struggle to deliver comprehensive support for VIIs, especially in the Proactive Reminder task, which demands accurate anticipation and real-time responsiveness. We hope VIABench will drive future research toward developing customized MLLMs for real-world assistance, ultimately improving navigation and interaction experiences for visually impaired individuals. Code and data will be released at https://github.com/MCG-NJU/VIABench.