SleepWalk: Um Benchmark de Três Níveis para Teste de Estresse de Navegação Visão-Linguagem Guiada por Instruções
SleepWalk: A Three-Tier Benchmark for Stress-Testing Instruction-Guided Vision-Language Navigation
May 11, 2026
Autores: Niyati Rawal, Sushant Ravva, Shah Alam Abir, Saksham Jain, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das
cs.AI
Resumo
Os Modelos de Visão-Linguagem (VLMs) avançaram rapidamente na percepção multimodal e na compreensão da linguagem, mas ainda não está claro se eles conseguem fundamentar a linguagem de forma confiável em ações espacialmente coerentes e plausivelmente executáveis em ambientes digitais 3D. Apresentamos o SleepWalk, um benchmark para avaliar a predição de trajetórias guiadas por instruções em mundos 3D de cena única, gerados a partir de descrições textuais de cenas e filtrados por navegabilidade. Diferentemente dos benchmarks de navegação anteriores, centrados na exploração de longo alcance entre salas, o SleepWalk visa o raciocínio incorporado localizado e centrado na interação: dadas observações visuais renderizadas e uma instrução em linguagem natural, o modelo deve prever uma trajetória que respeite a geometria da cena, evite colisões e termine em um local compatível com a ação. O benchmark abrange diversos ambientes internos e externos e organiza as tarefas em três níveis de dificuldade espacial e temporal, permitindo uma análise detalhada da fundamentação sob complexidade composicional crescente. Utilizando um protocolo de avaliação padronizado baseado em juiz pontual, avaliamos três VLMs de fronteira em 2.472 ambientes 3D selecionados, com nove instruções por cena. Os resultados revelam falhas sistemáticas no raciocínio espacial fundamentado, especialmente sob oclusão, restrições de interação e instruções de múltiplas etapas: o desempenho diminui à medida que o nível de dificuldade das tarefas aumenta. Em geral, os VLMs atuais conseguem produzir, até certo ponto, trajetórias que são simultaneamente espacialmente coerentes, plausivelmente executáveis e alinhadas com as ações pretendidas. Ao expor falhas em um ambiente controlado, porém escalável, o SleepWalk fornece um benchmark crítico para avançar o raciocínio multimodal fundamentado, o planejamento incorporado, a navegação visão-linguagem e agentes com capacidade de ação em ambientes 3D.
English
Vision-Language Models (VLMs) have advanced rapidly in multimodal perception and language understanding, yet it remains unclear whether they can reliably ground language into spatially coherent, plausibly executable actions in 3D digital environments. We introduce SleepWalk, a benchmark for evaluating instruction-grounded trajectory prediction in single-scene 3D worlds generated from textual scene descriptions and filtered for navigability. Unlike prior navigation benchmarks centered on long-range exploration across rooms, SleepWalk targets localized, interaction-centric embodied reasoning: given rendered visual observations and a natural-language instruction, a model must predict a trajectory that respects scene geometry, avoids collisions, and terminates at an action-compatible location. The benchmark covers diverse indoor and outdoor environments and organizes tasks into three tiers of spatial and temporal difficulty, enabling fine-grained analysis of grounding under increasing compositional complexity. Using a standardized pointwise judge-based evaluation protocol, we evaluate three frontier VLMs on 2,472 curated 3D environments with nine instructions per scene. Results reveal systematic failures in grounded spatial reasoning, especially under occlusion, interaction constraints, and multi-step instructions: performance drops as the difficulty level of the tasks increase. In general, current VLMs can somewhat produce trajectories that are simultaneously spatially coherent, plausibly executable, and aligned with intended actions. By exposing failures in a controlled yet scalable setting, SleepWalk provides a critical benchmark for advancing grounded multimodal reasoning, embodied planning, vision-language navigation, and action-capable agents in 3D environments.