Zelf in de ruimte: Benchmarken van zelfbewustzijn en ruimtelijke cognitie in UAV-belichaamde intelligentie
Self in Space: Benchmarking Self-Awareness and Spatial Cognition in UAV Embodied Intelligence
July 14, 2026
Auteurs: Zhishan Zou, Guoyan Sun, Zhiwei Wei, Jiancheng Pan, Yujie Li, Mugen Peng, Wenjia Xu
cs.AI
Samenvatting
Autonome UAV-systemen maken steeds vaker gebruik van multimodale grote taalmodellen (MLLM's) om te opereren in complexe, realistische omgevingen. Dergelijke belichaamde scenario's vereisen niet alleen begrip van de omringende ruimte, maar ook het onderhouden van een coherente representatie van de agent zelf. Bestaande UAV-gerichte benaderingen en benchmarks blijven echter grotendeels omgevingsgericht, met een primaire focus op taken voor ruimtelijk begrip, waarbij het zelfbewustzijn van de agent impliciet blijft. Om deze lacune aan te pakken, introduceren we SIS-Bench, een benchmark voor het evalueren van belichaamde ruimtelijke intelligentie in UAV-scenario's onder een uniforme zelf-in-ruimte-formulering. SIS-Bench organiseert evaluatie langs twee complementaire dimensies, ruimte en zelf, en een driedelige hiërarchie van perceptie, geheugen en redenering. Het bevat 4.856 vraag-antwoordparen verdeeld over 13 taken, afgeleid van 1.646 realistische UAV-video's via een taakconditioneringspijplijn met deskundigenvalidatie.
Uitgebreide evaluaties tonen aan dat huidige MLLM's fundamentele beperkingen vertonen in het modelleren van dynamische en agentgerichte processen. In het bijzonder zien we een duidelijke onbalans tussen ruimtelijke cognitie en zelfbewustzijn, evenals een progressieve afname in prestaties over cognitieve niveaus heen.
Gemotiveerd door deze bevindingen verkennen we verder een bewegingsbewuste representatie die zelfgerelateerde dynamiek integreert via optische flow en visuele kenmerkfusie. Experimentele resultaten laten zien dat het modelleren van agentbeweging consequent de perceptie- en geheugenprestaties verbetert, niet alleen in ruimtelijke cognitie maar ook in zelfbewustzijn, en generaliseert naar stroomafwaartse UAV-besluitvormingstaken.
Onze resultaten benadrukken het belang van zelfbewustzijn voor het bevorderen van belichaamde ruimtelijke intelligentie, en bieden zowel een nieuwe benchmark als empirisch bewijs voor bewegingsbewuste zelf-in-ruimte-modellering.
English
Autonomous UAV systems increasingly rely on multimodal large language models (MLLMs) to operate in complex real-world environments. Such embodied scenarios require not only understanding the surrounding space but also maintaining a coherent representation of the agent itself. However, existing UAV-oriented approaches and benchmarks remain largely environment-centric, primarily focusing on spatial understanding tasks, with the agent's self-awareness remaining implicit. To address this gap, we introduce SIS-Bench, a benchmark for evaluating embodied spatial intelligence in UAV scenarios under a unified self-in-space formulation. SIS-Bench organizes evaluation along two complementary dimensions, space and self, and a three-level hierarchy of perception, memory, and reasoning. It contains 4,856 question--answer pairs across 13 tasks derived from 1,646 real-world UAV videos through a task-conditioned construction pipeline with expert verification.Extensive evaluations reveal that current MLLMs exhibit fundamental limitations in modeling dynamic and agent-centered processes. In particular, we observe a clear imbalance between spatial cognition and self-awareness, as well as a progressive performance degradation across cognitive levels.Motivated by these findings, we further explore a motion-aware representation that incorporates self-related dynamics through optical flow and visual feature fusion. Experimental results show that modeling agent motion consistently improves perception and memory performance, not only in spatial cognition but also in self-awareness, and generalizes to downstream UAV decision-making tasks.Our results highlight the importance of self-awareness for advancing embodied spatial intelligence, and provide both a new benchmark and empirical evidence for motion-aware self-in-space modeling.