ChatPaper.aiChatPaper

Я в пространстве: бенчмаркинг самосознания и пространственного познания в воплощенном интеллекте БПЛА

Self in Space: Benchmarking Self-Awareness and Spatial Cognition in UAV Embodied Intelligence

July 14, 2026
Авторы: Zhishan Zou, Guoyan Sun, Zhiwei Wei, Jiancheng Pan, Yujie Li, Mugen Peng, Wenjia Xu
cs.AI

Аннотация

Автономные системы беспилотных летательных аппаратов (БПЛА) всё чаще полагаются на мультимодальные большие языковые модели (МБЯМ) для работы в сложных реальных средах. Такие воплощённые сценарии требуют не только понимания окружающего пространства, но и поддержания согласованного представления о самом агенте. Однако существующие ориентированные на БПЛА подходы и бенчмарки остаются по большей части средо-центрированными, сосредоточенными в первую очередь на задачах пространственного понимания, при этом самосознание агента остаётся неявным. Для устранения этого пробела мы представляем SIS-Bench — бенчмарк для оценки воплощённого пространственного интеллекта в сценариях с БПЛА в рамках единой формулировки «self-in-space». SIS-Bench организует оценку по двум взаимодополняющим измерениям — пространство и самость, — а также по трехуровневой иерархии восприятия, памяти и рассуждения. Он содержит 4856 пар вопрос–ответ по 13 задачам, полученным из 1646 видеозаписей реальных полётов БПЛА с помощью конвейера построения, обусловленного задачами, и экспертной верификации. Обширные оценки показывают, что современные МБЯМ демонстрируют фундаментальные ограничения в моделировании динамических и агент-центрированных процессов. В частности, мы наблюдаем явный дисбаланс между пространственным познанием и самосознанием, а также прогрессирующее ухудшение производительности по мере перехода между когнитивными уровнями. Руководствуясь этими результатами, мы далее исследуем представление, учитывающее движение, которое включает динамику, связанную с агентом, посредством слияния оптического потока и визуальных признаков. Экспериментальные результаты показывают, что моделирование движения агента последовательно улучшает производительность восприятия и памяти — как в пространственном познании, так и в самосознании, — и обобщается на последующие задачи принятия решений БПЛА. Наши результаты подчёркивают важность самосознания для продвижения воплощённого пространственного интеллекта и предоставляют как новый бенчмарк, так и эмпирические свидетельства в пользу моделирования «self-in-space» с учётом движения.
English
Autonomous UAV systems increasingly rely on multimodal large language models (MLLMs) to operate in complex real-world environments. Such embodied scenarios require not only understanding the surrounding space but also maintaining a coherent representation of the agent itself. However, existing UAV-oriented approaches and benchmarks remain largely environment-centric, primarily focusing on spatial understanding tasks, with the agent's self-awareness remaining implicit. To address this gap, we introduce SIS-Bench, a benchmark for evaluating embodied spatial intelligence in UAV scenarios under a unified self-in-space formulation. SIS-Bench organizes evaluation along two complementary dimensions, space and self, and a three-level hierarchy of perception, memory, and reasoning. It contains 4,856 question--answer pairs across 13 tasks derived from 1,646 real-world UAV videos through a task-conditioned construction pipeline with expert verification.Extensive evaluations reveal that current MLLMs exhibit fundamental limitations in modeling dynamic and agent-centered processes. In particular, we observe a clear imbalance between spatial cognition and self-awareness, as well as a progressive performance degradation across cognitive levels.Motivated by these findings, we further explore a motion-aware representation that incorporates self-related dynamics through optical flow and visual feature fusion. Experimental results show that modeling agent motion consistently improves perception and memory performance, not only in spatial cognition but also in self-awareness, and generalizes to downstream UAV decision-making tasks.Our results highlight the importance of self-awareness for advancing embodied spatial intelligence, and provide both a new benchmark and empirical evidence for motion-aware self-in-space modeling.