Vinci2: Ofreciendo asistencia proactiva en vídeos egocéntricos continuos
Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos
July 13, 2026
Autores: Gong Sitong, Tianyu Yan, Caixin Kang, Bo Zheng, Xiang Ruan, Huchuan Lu, Kaipeng Zhang, Yoichi Sato, Yifei Huang
cs.AI
Resumen
¿Cuándo debe un asistente inteligente tomar la palabra sin que se lo pidan? El vídeo egocéntrico continuo ofrece un contexto rico y en evolución que permite una nueva forma de asistencia: una que es proactiva en lugar de meramente reactiva. Sin embargo, los enfoques existentes o bien esperan pasivamente las consultas del usuario o tratan cada evento detectado como una situación que requiere respuesta, sin considerar el historial del usuario, su actividad actual o si la asistencia sería realmente bienvenida. Reformulamos la asistencia proactiva como un problema de decisión dependiente del contexto: el agente no solo debe percibir lo que está sucediendo, sino también razonar sobre el contexto temporal acumulado para determinar cuándo y si debe intervenir. Con este fin, presentamos Vinci2, un sistema de asistencia egocéntrica proactiva que avanza al asistente integrado Vinci desde la respuesta reactiva hacia la proactividad. En el ámbito de la evaluación, presentamos EgoServe, el primer punto de referencia a gran escala para la asistencia proactiva en vídeo egocéntrico continuo. EgoServe comprende más de 3.000 instancias de servicio organizadas según 4 horizontes de memoria temporal, que van desde alertas de seguridad inmediatas hasta entrenamiento de hábitos a largo plazo, en 10 categorías de servicio. En el ámbito del modelado, proponemos EgoMemo, un agente aumentado con memoria y sin necesidad de entrenamiento que mantiene tres representaciones de memoria complementarias: resúmenes temporales a múltiples escalas, un grafo de conocimiento semántico y archivos de incrustaciones visuales. En cada paso de tiempo, EgoMemo realiza un razonamiento aumentado por recuperación para determinar si la asistencia está justificada y, en caso afirmativo, produce respuestas fundamentadas contextualmente. Los experimentos demuestran que EgoMemo establece líneas base sólidas en EgoServe, al tiempo que se mantiene competitivo en los puntos de referencia egocéntricos existentes. Nuestro punto de referencia y código están disponibles públicamente en https://sitonggong.github.io/EgoServe-page/{Vinci2}.
English
When should an intelligent assistant speak up without being asked? Continuous egocentric video offers rich, evolving context that enables a new form of assistance: one that is proactive rather than merely reactive. Yet existing approaches either wait passively for user queries or treat every detected event as requiring a response, without considering the user's history, current activity, or whether assistance would actually be welcome. We reframe proactive assistance as a context-dependent decision problem: the agent must not only perceive what is happening, but reason over accumulated temporal context to determine when and whether to intervene. To this end, we present Vinci2, a proactive egocentric assistance system that advances the on-device assistant Vinci from reactive response toward proactivity. On the evaluation side, we present EgoServe, the first large-scale benchmark for proactive assistance in continuous egocentric video. EgoServe comprises over 3,000 service instances organized along 4 temporal memory horizons, ranging from immediate safety alerts to long-term habit coaching, across 10 service categories. On the modeling side, we propose EgoMemo, a training-free, memory-augmented agent that maintains three complementary memory representations: multi-scale temporal summaries, a semantic knowledge graph, and visual embedding archives. At each timestep, EgoMemo performs retrieval-augmented reasoning to determine whether assistance is warranted and, if so, produces contextually grounded responses. Experiments demonstrate that EgoMemo establishes strong baselines on EgoServe while remaining competitive on existing egocentric benchmarks. Our benchmark and code are publicly available at https://sitonggong.github.io/EgoServe-page/{Vinci2}.