Urban-ImageNet: Een grootschalige multimodale dataset en evaluatiekader voor de perceptie van stedelijke ruimte
Urban-ImageNet: A Large-Scale Multi-Modal Dataset and Evaluation Framework for Urban Space Perception
May 11, 2026
Auteurs: Yiwei Ou, Chung Ching Cheung, Jun Yang Ang, Xiaobin Ren, Ronggui Sun, Guansong Gao, Kaiqi Zhao, Manfredo Manfredini
cs.AI
Samenvatting
Wij presenteren Urban-ImageNet, een grootschalige multimodale dataset en evaluatiebenchmark voor de perceptie van stedelijke ruimtes op basis van door gebruikers gegenereerde socialmediabeelden. Het corpus bevat meer dan 2 miljoen openbare socialmediafoto's en bijbehorende tekstuele berichten, verzameld van Weibo op 61 stedelijke locaties in 24 Chinese steden tussen 2019 en 2025, met gecontroleerde benchmark-subsets op schalen van 1K, 10K en 100K, en een volledig 2M-corpus voor grootschalige training en evaluatie. Urban-ImageNet is georganiseerd volgens HUSIC, een hiërarchisch classificatiekader voor stedelijke ruimtebeelden dat een taxonomie van 10 klassen definieert, gebaseerd op stedentheorie. De taxonomie is ontworpen om onderscheid te maken tussen geactiveerde en niet-geactiveerde openbare ruimtes, exterieure en interieure stedelijke omgevingen, verblijfsruimtes, consumptie-inhoud, portretten en niet-ruimtelijke socialmediacontent. In plaats van stedelijke beelden te behandelen als generieke scènegegevens, evalueert Urban-ImageNet of machineperceptiemodellen ruimtelijke, sociale en functionele onderscheidingen kunnen vastleggen die centraal staan in stedelijke studies. De benchmark ondersteunt drie taken binnen één gestandaardiseerde bibliotheek: (T1) semantische classificatie van stedelijke scènes, (T2) cross-modale beeld-tekstretrieval, en (T3) instance-segmentatie. Onze experimenten evalueren representatieve visie-, visie-taal- en segmentatiemodellen, en tonen sterke prestaties aan op het gebied van gesuperviseerde scèneclassificatie, maar uitdagender gedrag bij cross-modale retrieval en instance-gebaseerde segmentatie van stedelijke objecten. Een multischaalstudie onderzoekt verder hoe modelprestaties veranderen naarmate de gebalanceerde trainingsdata toenemen van 1K, 10K tot 100K afbeeldingen. Urban-ImageNet biedt een uniforme, theoretisch onderbouwde, multi-stedelijke benchmark voor het evalueren van hoe AI-systemen hedendaagse stedelijke ruimtes waarnemen en interpreteren over modaliteiten, schalen en taakformuleringen heen. De dataset en benchmark zijn beschikbaar op: huggingface.co/datasets/Yiwei-Ou/Urban-ImageNet en github.com/yiasun/dataset-2.
English
We present Urban-ImageNet, a large-scale multi-modal dataset and evaluation benchmark for urban space perception from user-generated social media imagery. The corpus contains over 2 Million public social media images and paired textual posts collected from Weibo across 61 urban sites in 24 Chinese cities across 2019-2025, with controlled benchmark subsets at 1K, 10K, and 100K scale and a full 2M corpus for large-scale training and evaluation. Urban-ImageNet is organized by HUSIC, a Hierarchical Urban Space Image Classification framework that defines a 10-class taxonomy grounded in urban theory. The taxonomy is designed to distinguish activated and non-activated public spaces, exterior and interior urban environments, accommodation spaces, consumption content, portraits, and non-spatial social-media content. Rather than treating urban imagery as generic scene data, Urban-ImageNet evaluates whether machine perception models can capture spatial, social, and functional distinctions that are central to urban studies. The benchmark supports three tasks within one standardized library: (T1) urban scene semantic classification, (T2) cross-modal image-text retrieval, and (T3) instance segmentation. Our experiments evaluate representative vision, vision-language, and segmentation models, revealing strong performance on supervised scene classification but more challenging behavior in cross-modal retrieval and instance-level urban object segmentation. A multi-scale study further examines how model performance changes as balanced training data increases from 1K, 10K to 100K images. Urban-ImageNet provides a unified, theory-grounded, multi-city benchmark for evaluating how AI systems perceive and interpret contemporary urban spaces across modalities, scales, and task formulations. Dataset and benchmark are available at: huggingface.co/datasets/Yiwei-Ou/Urban-ImageNet and github.com/yiasun/dataset-2.