Urban-ImageNet: Um Conjunto de Dados Multimodal em Grande Escala e Estrutura de Avaliação para Percepção do Espaço Urbano
Urban-ImageNet: A Large-Scale Multi-Modal Dataset and Evaluation Framework for Urban Space Perception
May 11, 2026
Autores: Yiwei Ou, Chung Ching Cheung, Jun Yang Ang, Xiaobin Ren, Ronggui Sun, Guansong Gao, Kaiqi Zhao, Manfredo Manfredini
cs.AI
Resumo
Apresentamos o Urban-ImageNet, um conjunto de dados multimodal em larga escala e um benchmark de avaliação para a percepção de espaços urbanos a partir de imagens de mídias sociais geradas por usuários. O corpus contém mais de 2 milhões de imagens públicas de mídias sociais e postagens textuais emparelhadas, coletadas do Weibo em 61 locais urbanos em 24 cidades chinesas entre 2019 e 2025, com subconjuntos de benchmark controlados nas escalas de 1K, 10K e 100K, além de um corpus completo de 2M para treinamento e avaliação em grande escala. O Urban-ImageNet é organizado pelo HUSIC, uma estrutura hierárquica de classificação de imagens de espaços urbanos que define uma taxonomia de 10 classes fundamentada na teoria urbana. A taxonomia é projetada para distinguir espaços públicos ativados e não ativados, ambientes urbanos externos e internos, espaços de acomodação, conteúdo de consumo, retratos e conteúdo não espacial de mídias sociais. Em vez de tratar imagens urbanas como dados genéricos de cena, o Urban-ImageNet avalia se modelos de percepção de máquina podem capturar distinções espaciais, sociais e funcionais centrais para os estudos urbanos. O benchmark oferece suporte a três tarefas dentro de uma biblioteca padronizada: (T1) classificação semântica de cenas urbanas, (T2) recuperação multimodal de imagem-texto e (T3) segmentação de instâncias. Nossos experimentos avaliam modelos representativos de visão, visão-linguagem e segmentação, revelando um desempenho robusto na classificação supervisionada de cenas, mas um comportamento mais desafiador na recuperação multimodal e na segmentação de objetos urbanos em nível de instância. Um estudo multiescala examina ainda como o desempenho do modelo muda à medida que os dados de treinamento balanceados aumentam de 1K, 10K para 100K imagens. O Urban-ImageNet fornece um benchmark unificado, teoricamente fundamentado e multicidades para avaliar como os sistemas de IA percebem e interpretam espaços urbanos contemporâneos em diferentes modalidades, escalas e formulações de tarefas. O conjunto de dados e o benchmark estão disponíveis em: huggingface.co/datasets/Yiwei-Ou/Urban-ImageNet e github.com/yiasun/dataset-2.
English
We present Urban-ImageNet, a large-scale multi-modal dataset and evaluation benchmark for urban space perception from user-generated social media imagery. The corpus contains over 2 Million public social media images and paired textual posts collected from Weibo across 61 urban sites in 24 Chinese cities across 2019-2025, with controlled benchmark subsets at 1K, 10K, and 100K scale and a full 2M corpus for large-scale training and evaluation. Urban-ImageNet is organized by HUSIC, a Hierarchical Urban Space Image Classification framework that defines a 10-class taxonomy grounded in urban theory. The taxonomy is designed to distinguish activated and non-activated public spaces, exterior and interior urban environments, accommodation spaces, consumption content, portraits, and non-spatial social-media content. Rather than treating urban imagery as generic scene data, Urban-ImageNet evaluates whether machine perception models can capture spatial, social, and functional distinctions that are central to urban studies. The benchmark supports three tasks within one standardized library: (T1) urban scene semantic classification, (T2) cross-modal image-text retrieval, and (T3) instance segmentation. Our experiments evaluate representative vision, vision-language, and segmentation models, revealing strong performance on supervised scene classification but more challenging behavior in cross-modal retrieval and instance-level urban object segmentation. A multi-scale study further examines how model performance changes as balanced training data increases from 1K, 10K to 100K images. Urban-ImageNet provides a unified, theory-grounded, multi-city benchmark for evaluating how AI systems perceive and interpret contemporary urban spaces across modalities, scales, and task formulations. Dataset and benchmark are available at: huggingface.co/datasets/Yiwei-Ou/Urban-ImageNet and github.com/yiasun/dataset-2.