.SleepWalk: Een drielagenbenchmark voor het stresstesten van instructiegestuurde visueel-taalkundige navigatie
SleepWalk: A Three-Tier Benchmark for Stress-Testing Instruction-Guided Vision-Language Navigation
May 11, 2026
Auteurs: Niyati Rawal, Sushant Ravva, Shah Alam Abir, Saksham Jain, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das
cs.AI
Samenvatting
Visie-Taalmodellen (VLMs) zijn snel vooruitgegaan in multimodale perceptie en taalbegrip, maar het blijft onduidelijk of ze taal op betrouwbare wijze kunnen gronden in ruimtelijk coherente, plausibel uitvoerbare acties in 3D-digitale omgevingen. We introduceren SleepWalk, een benchmark voor het evalueren van instructie-gegronde trajectvoorspelling in enkel-scène 3D-werelden die zijn gegenereerd uit tekstuele scènebeschrijvingen en gefilterd op navigeerbaarheid. In tegenstelling tot eerdere navigatiebenchmarks die gericht zijn op langeafstandsverkenning door kamers heen, richt SleepWalk zich op gelokaliseerd, interactiegericht belichaamd redeneren: gegeven gerenderde visuele waarnemingen en een natuurlijke-taal instructie, moet een model een traject voorspellen dat de scènegeometrie respecteert, botsingen vermijdt en eindigt op een actie-compatibele locatie. De benchmark omvat diverse binnen- en buitenomgevingen en organiseert taken in drie niveaus van ruimtelijke en temporele moeilijkheidsgraad, wat een gedetailleerde analyse van gronding onder toenemende compositionele complexiteit mogelijk maakt. Met behulp van een gestandaardiseerd puntgewijs op een beoordelaar gebaseerd evaluatieprotocol evalueren we drie frontier-VLMs op 2.472 samengestelde 3D-omgevingen met negen instructies per scène. Resultaten onthullen systematische fouten in gegronde ruimtelijke redenering, vooral onder occlusie, interactiebeperkingen en meerstapsinstructies: de prestaties dalen naarmate het moeilijkheidsniveau van de taken toeneemt. Over het algemeen kunnen huidige VLMs enigszins trajecten produceren die tegelijkertijd ruimtelijk coherent, plausibel uitvoerbaar en afgestemd op de beoogde acties zijn. Door fouten bloot te leggen in een gecontroleerde maar schaalbare omgeving, biedt SleepWalk een kritische benchmark voor het bevorderen van gegronde multimodale redenering, belichaamde planning, visie-taalnavigatie en actiebekwame agenten in 3D-omgevingen.
English
Vision-Language Models (VLMs) have advanced rapidly in multimodal perception and language understanding, yet it remains unclear whether they can reliably ground language into spatially coherent, plausibly executable actions in 3D digital environments. We introduce SleepWalk, a benchmark for evaluating instruction-grounded trajectory prediction in single-scene 3D worlds generated from textual scene descriptions and filtered for navigability. Unlike prior navigation benchmarks centered on long-range exploration across rooms, SleepWalk targets localized, interaction-centric embodied reasoning: given rendered visual observations and a natural-language instruction, a model must predict a trajectory that respects scene geometry, avoids collisions, and terminates at an action-compatible location. The benchmark covers diverse indoor and outdoor environments and organizes tasks into three tiers of spatial and temporal difficulty, enabling fine-grained analysis of grounding under increasing compositional complexity. Using a standardized pointwise judge-based evaluation protocol, we evaluate three frontier VLMs on 2,472 curated 3D environments with nine instructions per scene. Results reveal systematic failures in grounded spatial reasoning, especially under occlusion, interaction constraints, and multi-step instructions: performance drops as the difficulty level of the tasks increase. In general, current VLMs can somewhat produce trajectories that are simultaneously spatially coherent, plausibly executable, and aligned with intended actions. By exposing failures in a controlled yet scalable setting, SleepWalk provides a critical benchmark for advancing grounded multimodal reasoning, embodied planning, vision-language navigation, and action-capable agents in 3D environments.