ChatPaper.aiChatPaper

Light-Omni: Рефлекс над рассуждением в агентивном понимании видео с долговременной памятью

Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory

July 6, 2026
Авторы: Chang Nie, Jiaju Wei, Junlan Feng, Chaoyou Fu, Caifeng Shan
cs.AI

Аннотация

Агентное понимание видео наделяет модели долговременной памятью для автономной обработки и реагирования на непрерывные, длительные мультимодальные потоки. Однако продвинутые видеоагенты часто полагаются на «детективное» итеративное рассуждение для управления действиями (например, поиск) и агрегации свидетельств, что влечет за собой непомерные затраты и задержки. Мы утверждаем, что такое тяжелое рассуждение в основном компенсирует отсутствие глобального контекста и семантическое рассогласование при поиске. В этой статье представлен Light-Omni — мультимодальный агентный фреймворк для рефлексивного и легковесного понимания видео. Это достигается за счет двойных контекстуальных состояний, которые мгновенно формируют необходимый контекст за один прямой проход. Во-первых, мы поддерживаем глобальное состояние — конечный мультимодальный сценарий, непрерывно консолидируемый из эпизодической памяти, служащий глобальным контекстом для Light-Omni. Посредством иерархического слияния он сохраняет недавние детали, одновременно обобщая прошлые события. Во-вторых, на основе этого глобального контекста мы генерируем параметрическое латентное состояние, которое напрямую управляет автономными действиями и создает эмбеддинги для поиска с минимальной задержкой. Благодаря такой связанной конструкции Light-Omni достигает семантически согласованного поиска и рефлексивных ответов, избегая итеративного рассуждения. Обширные эксперименты подтверждают эффективность Light-Omni на нескольких видео-бенчмарках. Примечательно, что он превосходит M3-Agent со средним приростом точности на 2,4%, ускорением в 12,1 раза и улучшением эффективности использования памяти GPU в 2,6 раза. Кроме того, он служит системой памяти, повышающей как производительность, так и эффективность существующих MLLM. Страница проекта: https://clare-nie.github.io/Light-Omni.
English
Agentic video understanding equips models with long-term memory to autonomously process and respond to continuous, long-horizon multimodal streams. However, advanced video agents often rely on ``detective-style'' iterative reasoning for action control (e.g., search) and evidence aggregation, incurring prohibitive costs and latency. We argue that such heavy reasoning primarily compensates for the lack of global context and semantic misalignment in retrieval. This paper introduces Light-Omni, a multimodal agent framework for reflexive and lightweight video understanding. It achieves this through dual contextual states that instantly build the required context in a single forward pass. First, we maintain a global state, a finite-sized multimodal script continuously consolidated from episodic memory, serving as the global context for Light-Omni. Through hierarchical merging, it preserves recent details while summarizing past events. Second, conditioned on this global context, we generate a parametric latent state that directly drives autonomous actions and produces retrieval embeddings, with minimal latency. Benefiting from this coupled design, Light-Omni achieves semantically aligned retrieval and reflexive responses while avoiding iterative reasoning. Extensive experiments validate the effectiveness of Light-Omni across multiple video benchmarks. Notably, it outperforms M3-Agent with an average 2.4% accuracy gain, a 12.1times speedup, and a 2.6times improvement in GPU memory efficiency. Furthermore, it serves as a memory system to enhance both the performance and efficiency of existing MLLMs. Project page: https://clare-nie.github.io/Light-Omni.