Le soi dans l’espace : évaluation comparative de la conscience de soi et de la cognition spatiale dans l’intelligence incarnée des drones
Self in Space: Benchmarking Self-Awareness and Spatial Cognition in UAV Embodied Intelligence
July 14, 2026
Auteurs: Zhishan Zou, Guoyan Sun, Zhiwei Wei, Jiancheng Pan, Yujie Li, Mugen Peng, Wenjia Xu
cs.AI
Résumé
Les systèmes de drones autonomes s'appuient de plus en plus sur des modèles de langage multimodaux de grande taille (MLLMs) pour opérer dans des environnements réels complexes. De tels scénarios incarnés nécessitent non seulement une compréhension de l'espace environnant, mais aussi le maintien d'une représentation cohérente de l'agent lui-même. Cependant, les approches et les références existantes orientées vers les drones restent largement centrées sur l'environnement, se concentrant principalement sur des tâches de compréhension spatiale, la conscience de soi de l'agent restant implicite. Pour combler cette lacune, nous présentons SIS-Bench, un banc d'essai pour évaluer l'intelligence spatiale incarnée dans des scénarios de drones sous une formulation unifiée du soi-dans-l'espace. SIS-Bench organise l'évaluation selon deux dimensions complémentaires, l'espace et le soi, et une hiérarchie à trois niveaux de perception, mémoire et raisonnement. Il contient 4 856 paires question-répartition réparties sur 13 tâches, dérivées de 1 646 vidéos réelles de drones via un pipeline de construction conditionné par les tâches avec une vérification par des experts. Des évaluations approfondies révèlent que les MLLMs actuels présentent des limitations fondamentales dans la modélisation des processus dynamiques et centrés sur l'agent. En particulier, nous observons un déséquilibre clair entre la cognition spatiale et la conscience de soi, ainsi qu'une dégradation progressive des performances à travers les niveaux cognitifs. Motivés par ces résultats, nous explorons plus en détail une représentation consciente du mouvement qui intègre les dynamiques liées au soi via le flux optique et la fusion de caractéristiques visuelles. Les résultats expérimentaux montrent que la modélisation du mouvement de l'agent améliore systématiquement les performances de perception et de mémoire, non seulement dans la cognition spatiale mais aussi dans la conscience de soi, et se généralise à des tâches aval de prise de décision pour les drones. Nos résultats soulignent l'importance de la conscience de soi pour faire progresser l'intelligence spatiale incarnée, et fournissent à la fois un nouveau banc d'essai et des preuves empiriques pour la modélisation du soi-dans-l'espace consciente du mouvement.
English
Autonomous UAV systems increasingly rely on multimodal large language models (MLLMs) to operate in complex real-world environments. Such embodied scenarios require not only understanding the surrounding space but also maintaining a coherent representation of the agent itself. However, existing UAV-oriented approaches and benchmarks remain largely environment-centric, primarily focusing on spatial understanding tasks, with the agent's self-awareness remaining implicit. To address this gap, we introduce SIS-Bench, a benchmark for evaluating embodied spatial intelligence in UAV scenarios under a unified self-in-space formulation. SIS-Bench organizes evaluation along two complementary dimensions, space and self, and a three-level hierarchy of perception, memory, and reasoning. It contains 4,856 question--answer pairs across 13 tasks derived from 1,646 real-world UAV videos through a task-conditioned construction pipeline with expert verification.Extensive evaluations reveal that current MLLMs exhibit fundamental limitations in modeling dynamic and agent-centered processes. In particular, we observe a clear imbalance between spatial cognition and self-awareness, as well as a progressive performance degradation across cognitive levels.Motivated by these findings, we further explore a motion-aware representation that incorporates self-related dynamics through optical flow and visual feature fusion. Experimental results show that modeling agent motion consistently improves perception and memory performance, not only in spatial cognition but also in self-awareness, and generalizes to downstream UAV decision-making tasks.Our results highlight the importance of self-awareness for advancing embodied spatial intelligence, and provide both a new benchmark and empirical evidence for motion-aware self-in-space modeling.