Benchmark de Competência Espacial
Spatial Competence Benchmark
March 5, 2026
Autores: Jash Vira, Ashley Harris
cs.AI
Resumo
A competência espacial é a qualidade de manter uma representação interna consistente de um ambiente e utilizá-la para inferir estrutura discreta e planear ações sob restrições. As avaliações espaciais predominantes para modelos de grande escala limitam-se a sondar primitivas isoladas através de transformações 3D ou de resposta a perguntas visuais. Apresentamos o *Spatial Competence Benchmark* (SCBench), abrangendo três grupos hierárquicos de capacidades cujas tarefas requerem saídas executáveis verificadas por verificadores determinísticos ou avaliadores baseados em simulador. No SCBench, três modelos de vanguarda exibem uma precisão monotonicamente decrescente à medida que se sobe na escada de capacidades. Uma análise abrangente dos limites de *tokens* de saída mostra que os ganhos de precisão concentram-se em orçamentos baixos e saturam rapidamente, e as falhas são dominadas por geometria localmente plausível que viola restrições globais. Disponibilizamos os geradores de tarefas, verificadores e ferramentas de visualização.
English
Spatial competence is the quality of maintaining a consistent internal representation of an environment and using it to infer discrete structure and plan actions under constraints. Prevailing spatial evaluations for large models are limited to probing isolated primitives through 3D transformations or visual question answering. We introduce the Spatial Competence Benchmark (SCBench), spanning three hierarchical capability buckets whose tasks require executable outputs verified by deterministic checkers or simulator-based evaluators. On SCBench, three frontier models exhibit monotonically decreasing accuracy up the capability ladder. Sweeping output-token caps shows that accuracy gains concentrate at low budgets and saturate quickly, and failures are dominated by locally plausible geometry that breaks global constraints. We release the task generators, verifiers, and visualisation tooling.