Light-Omni: Reflex boven Redeneren in Agentisch Videobegrip met Langetermijngeheugen
Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory
July 6, 2026
Auteurs: Chang Nie, Jiaju Wei, Junlan Feng, Chaoyou Fu, Caifeng Shan
cs.AI
Samenvatting
Agentisch videobegrip voorziet modellen van langetermijngeheugen om autonoom continue, langdurige multimodale stromen te verwerken en erop te reageren. Geavanceerde video-agenten vertrouwen echter vaak op een "detective-achtige" iteratieve redenering voor actiecontrole (bv. zoeken) en bewijsvorming, wat leidt tot prohibitieve kosten en latentie. Wij stellen dat dergelijke zware redenering vooral compenseert voor het gebrek aan globale context en semantische misalignatie in het ophalen. Dit artikel introduceert Light-Omni, een multimodaal agent-framework voor reflexief en lichtgewicht videobegrip. Dit wordt bereikt via duale contextuele toestanden die de benodigde context in één enkele forward-pass direct opbouwen. Ten eerste onderhouden we een globale toestand, een eindig multimodaal script dat continu wordt geconsolideerd uit episodisch geheugen en dient als globale context voor Light-Omni. Door hiërarchische samenvoeging worden recente details behouden terwijl gebeurtenissen uit het verleden worden samengevat. Ten tweede genereren we, geconditioneerd op deze globale context, een parametrische latente toestand die autonome acties direct aanstuurt en retrieval-embeddings produceert, met minimale latentie. Dankzij dit gekoppelde ontwerp bereikt Light-Omni semantisch afgestemd ophalen en reflexieve reacties, zonder iteratieve redenering. Uitgebreide experimenten valideren de effectiviteit van Light-Omni op meerdere video-benchmarks. Met name overtreft het M3-Agent met een gemiddelde nauwkeurigheidstoename van 2,4%, een 12,1× versnelling en een 2,6× verbetering in GPU-geheugenefficiëntie. Bovendien dient het als een geheugensysteem om zowel de prestaties als de efficiëntie van bestaande MLLM's te verbeteren. Projectpagina: https://clare-nie.github.io/Light-Omni.
English
Agentic video understanding equips models with long-term memory to autonomously process and respond to continuous, long-horizon multimodal streams. However, advanced video agents often rely on ``detective-style'' iterative reasoning for action control (e.g., search) and evidence aggregation, incurring prohibitive costs and latency. We argue that such heavy reasoning primarily compensates for the lack of global context and semantic misalignment in retrieval. This paper introduces Light-Omni, a multimodal agent framework for reflexive and lightweight video understanding. It achieves this through dual contextual states that instantly build the required context in a single forward pass. First, we maintain a global state, a finite-sized multimodal script continuously consolidated from episodic memory, serving as the global context for Light-Omni. Through hierarchical merging, it preserves recent details while summarizing past events. Second, conditioned on this global context, we generate a parametric latent state that directly drives autonomous actions and produces retrieval embeddings, with minimal latency. Benefiting from this coupled design, Light-Omni achieves semantically aligned retrieval and reflexive responses while avoiding iterative reasoning. Extensive experiments validate the effectiveness of Light-Omni across multiple video benchmarks. Notably, it outperforms M3-Agent with an average 2.4% accuracy gain, a 12.1times speedup, and a 2.6times improvement in GPU memory efficiency. Furthermore, it serves as a memory system to enhance both the performance and efficiency of existing MLLMs. Project page: https://clare-nie.github.io/Light-Omni.