Light-Omni : Le réflexe plutôt que le raisonnement dans la compréhension vidéo agentique avec mémoire à long terme
Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory
July 6, 2026
Auteurs: Chang Nie, Jiaju Wei, Junlan Feng, Chaoyou Fu, Caifeng Shan
cs.AI
Résumé
La compréhension vidéo agentique dote les modèles d'une mémoire à long terme pour traiter et répondre de manière autonome à des flux multimodaux continus et à long horizon. Cependant, les agents vidéo avancés s'appuient souvent sur un raisonnement itératif "de type détective" pour le contrôle des actions (par exemple, la recherche) et l'agrégation de preuves, ce qui entraîne des coûts et une latence prohibitifs. Nous soutenons qu'un tel raisonnement lourd compense principalement le manque de contexte global et le désalignement sémantique dans la récupération. Cet article présente Light-Omni, un cadre d'agent multimodal pour une compréhension vidéo réflexive et légère. Il y parvient grâce à des états contextuels doubles qui construisent instantanément le contexte requis en un seul passage avant. Tout d'abord, nous maintenons un état global, un script multimodal de taille finie continuellement consolidé à partir de la mémoire épisodique, servant de contexte global pour Light-Omni. Par fusion hiérarchique, il préserve les détails récents tout en résumant les événements passés. Ensuite, conditionné par ce contexte global, nous générons un état latent paramétrique qui pilote directement les actions autonomes et produit des embeddings de récupération, avec une latence minimale. Grâce à cette conception couplée, Light-Omni parvient à une récupération sémantiquement alignée et à des réponses réflexes tout en évitant le raisonnement itératif. Des expériences approfondies valident l'efficacité de Light-Omni sur plusieurs benchmarks vidéo. Notamment, il surpasse M3-Agent avec un gain de précision moyen de 2,4 %, une accélération de 12,1 fois et une amélioration de l'efficacité mémoire GPU de 2,6 fois. De plus, il sert de système de mémoire pour améliorer à la fois les performances et l'efficacité des MLLMs existants. Page du projet : https://clare-nie.github.io/Light-Omni.
English
Agentic video understanding equips models with long-term memory to autonomously process and respond to continuous, long-horizon multimodal streams. However, advanced video agents often rely on ``detective-style'' iterative reasoning for action control (e.g., search) and evidence aggregation, incurring prohibitive costs and latency. We argue that such heavy reasoning primarily compensates for the lack of global context and semantic misalignment in retrieval. This paper introduces Light-Omni, a multimodal agent framework for reflexive and lightweight video understanding. It achieves this through dual contextual states that instantly build the required context in a single forward pass. First, we maintain a global state, a finite-sized multimodal script continuously consolidated from episodic memory, serving as the global context for Light-Omni. Through hierarchical merging, it preserves recent details while summarizing past events. Second, conditioned on this global context, we generate a parametric latent state that directly drives autonomous actions and produces retrieval embeddings, with minimal latency. Benefiting from this coupled design, Light-Omni achieves semantically aligned retrieval and reflexive responses while avoiding iterative reasoning. Extensive experiments validate the effectiveness of Light-Omni across multiple video benchmarks. Notably, it outperforms M3-Agent with an average 2.4% accuracy gain, a 12.1times speedup, and a 2.6times improvement in GPU memory efficiency. Furthermore, it serves as a memory system to enhance both the performance and efficiency of existing MLLMs. Project page: https://clare-nie.github.io/Light-Omni.