ChatPaper.aiChatPaper

Light-Omni: Reflejo sobre el razonamiento en la comprensión de video agentiva con memoria a largo plazo

Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory

July 6, 2026
Autores: Chang Nie, Jiaju Wei, Junlan Feng, Chaoyou Fu, Caifeng Shan
cs.AI

Resumen

La comprensión de video agéntica dota a los modelos de memoria a largo plazo para procesar y responder de forma autónoma a flujos multimodales continuos y de largo horizonte. Sin embargo, los agentes de video avanzados a menudo recurren a un razonamiento iterativo de "estilo detectivesco" para el control de acciones (por ejemplo, búsqueda) y la agregación de evidencia, lo que conlleva costos y latencias prohibitivos. Sostenemos que este razonamiento intensivo compensa principalmente la falta de contexto global y el desalineamiento semántico en la recuperación. Este artículo presenta Light-Omni, un marco de agente multimodal para la comprensión de video reflexiva y ligera. Lo logra mediante estados contextuales duales que construyen instantáneamente el contexto requerido en una sola pasada hacia adelante. Primero, mantenemos un estado global, un guion multimodal de tamaño finito consolidado continuamente a partir de la memoria episódica, que sirve como contexto global para Light-Omni. Mediante fusión jerárquica, preserva detalles recientes mientras resume eventos pasados. Segundo, condicionado a este contexto global, generamos un estado latente paramétrico que impulsa directamente acciones autónomas y produce embeddings de recuperación, con latencia mínima. Gracias a este diseño acoplado, Light-Omni logra una recuperación semánticamente alineada y respuestas reflexivas, evitando el razonamiento iterativo. Extensos experimentos validan la efectividad de Light-Omni en múltiples benchmarks de video. En particular, supera a M3-Agent con una ganancia promedio de precisión del 2.4 %, una aceleración de 12.1 veces y una mejora de 2.6 veces en la eficiencia de memoria GPU. Además, sirve como sistema de memoria para mejorar tanto el rendimiento como la eficiencia de los MLLM existentes. Página del proyecto: https://clare-nie.github.io/Light-Omni.
English
Agentic video understanding equips models with long-term memory to autonomously process and respond to continuous, long-horizon multimodal streams. However, advanced video agents often rely on ``detective-style'' iterative reasoning for action control (e.g., search) and evidence aggregation, incurring prohibitive costs and latency. We argue that such heavy reasoning primarily compensates for the lack of global context and semantic misalignment in retrieval. This paper introduces Light-Omni, a multimodal agent framework for reflexive and lightweight video understanding. It achieves this through dual contextual states that instantly build the required context in a single forward pass. First, we maintain a global state, a finite-sized multimodal script continuously consolidated from episodic memory, serving as the global context for Light-Omni. Through hierarchical merging, it preserves recent details while summarizing past events. Second, conditioned on this global context, we generate a parametric latent state that directly drives autonomous actions and produces retrieval embeddings, with minimal latency. Benefiting from this coupled design, Light-Omni achieves semantically aligned retrieval and reflexive responses while avoiding iterative reasoning. Extensive experiments validate the effectiveness of Light-Omni across multiple video benchmarks. Notably, it outperforms M3-Agent with an average 2.4% accuracy gain, a 12.1times speedup, and a 2.6times improvement in GPU memory efficiency. Furthermore, it serves as a memory system to enhance both the performance and efficiency of existing MLLMs. Project page: https://clare-nie.github.io/Light-Omni.