ChatPaper.aiChatPaper

Light-Omni: Reflexo sobre Raciocínio na Compreensão de Vídeo Agêntica com Memória de Longo Prazo

Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory

July 6, 2026
Autores: Chang Nie, Jiaju Wei, Junlan Feng, Chaoyou Fu, Caifeng Shan
cs.AI

Resumo

A compreensão agentiva de vídeo equipa modelos com memória de longo prazo para processar e responder de forma autônoma a fluxos multimodais contínuos e de longo horizonte. No entanto, agentes de vídeo avançados frequentemente dependem de raciocínio iterativo "detetivesco" para controle de ações (por exemplo, busca) e agregação de evidências, incorrendo em custos e latência proibitivos. Argumentamos que esse raciocínio pesado compensa principalmente a falta de contexto global e o desalinhamento semântico na recuperação. Este artigo apresenta o Light-Omni, uma estrutura de agente multimodal para compreensão de vídeo reflexiva e leve. Isso é alcançado por meio de estados contextuais duais que constroem instantaneamente o contexto necessário em uma única passagem direta. Primeiro, mantemos um estado global, um script multimodal de tamanho finito continuamente consolidado a partir da memória episódica, servindo como contexto global para o Light-Omni. Por meio de fusão hierárquica, ele preserva detalhes recentes enquanto resume eventos passados. Segundo, condicionado a esse contexto global, geramos um estado latente paramétrico que impulsiona diretamente ações autônomas e produz embeddings de recuperação, com latência mínima. Beneficiando-se desse design acoplado, o Light-Omni alcança recuperação semanticamente alinhada e respostas reflexivas, evitando raciocínio iterativo. Extensos experimentos validam a eficácia do Light-Omni em vários benchmarks de vídeo. Notavelmente, ele supera o M3-Agent com um ganho médio de precisão de 2,4%, uma aceleração de 12,1 vezes e uma melhoria de 2,6 vezes na eficiência de memória GPU. Além disso, serve como um sistema de memória para melhorar tanto o desempenho quanto a eficiência dos MLLMs existentes. Página do projeto: https://clare-nie.github.io/Light-Omni.
English
Agentic video understanding equips models with long-term memory to autonomously process and respond to continuous, long-horizon multimodal streams. However, advanced video agents often rely on ``detective-style'' iterative reasoning for action control (e.g., search) and evidence aggregation, incurring prohibitive costs and latency. We argue that such heavy reasoning primarily compensates for the lack of global context and semantic misalignment in retrieval. This paper introduces Light-Omni, a multimodal agent framework for reflexive and lightweight video understanding. It achieves this through dual contextual states that instantly build the required context in a single forward pass. First, we maintain a global state, a finite-sized multimodal script continuously consolidated from episodic memory, serving as the global context for Light-Omni. Through hierarchical merging, it preserves recent details while summarizing past events. Second, conditioned on this global context, we generate a parametric latent state that directly drives autonomous actions and produces retrieval embeddings, with minimal latency. Benefiting from this coupled design, Light-Omni achieves semantically aligned retrieval and reflexive responses while avoiding iterative reasoning. Extensive experiments validate the effectiveness of Light-Omni across multiple video benchmarks. Notably, it outperforms M3-Agent with an average 2.4% accuracy gain, a 12.1times speedup, and a 2.6times improvement in GPU memory efficiency. Furthermore, it serves as a memory system to enhance both the performance and efficiency of existing MLLMs. Project page: https://clare-nie.github.io/Light-Omni.