ChatPaper.aiChatPaper

Vinci2: Fornecendo Assistência Proativa em Vídeos Egocêntricos Contínuos

Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos

July 13, 2026
Autores: Gong Sitong, Tianyu Yan, Caixin Kang, Bo Zheng, Xiang Ruan, Huchuan Lu, Kaipeng Zhang, Yoichi Sato, Yifei Huang
cs.AI

Resumo

Quando um assistente inteligente deve intervir sem ser solicitado? Vídeos egocêntricos contínuos oferecem um contexto rico e em evolução que possibilita uma nova forma de assistência: uma que é proativa em vez de meramente reativa. No entanto, as abordagens existentes ou aguardam passivamente por consultas do usuário ou tratam cada evento detectado como uma situação que exige resposta, sem considerar o histórico do usuário, sua atividade atual ou se a assistência seria realmente bem-vinda. Reformulamos a assistência proativa como um problema de decisão dependente de contexto: o agente não só deve perceber o que está acontecendo, mas também raciocinar sobre o contexto temporal acumulado para determinar quando e se deve intervir. Para isso, apresentamos o Vinci2, um sistema proativo de assistência egocêntrica que avança o assistente de dispositivo Vinci da resposta reativa para a proatividade. No lado da avaliação, apresentamos o EgoServe, o primeiro benchmark em grande escala para assistência proativa em vídeo egocêntrico contínuo. O EgoServe compreende mais de 3.000 instâncias de serviço organizadas em 4 horizontes de memória temporal, variando de alertas de segurança imediatos a treinamento de hábitos de longo prazo, em 10 categorias de serviço. No lado da modelagem, propomos o EgoMemo, um agente livre de treinamento e aumentado por memória que mantém três representações complementares de memória: resumos temporais em múltiplas escalas, um grafo de conhecimento semântico e arquivos de embeddings visuais. A cada passo temporal, o EgoMemo realiza raciocínio aumentado por recuperação (retrieval-augmented reasoning) para determinar se a assistência é justificada e, se for, produz respostas contextualmente fundamentadas. Experimentos demonstram que o EgoMemo estabelece linhas de base fortes no EgoServe, mantendo-se competitivo em benchmarks egocêntricos existentes. Nosso benchmark e código estão disponíveis publicamente em https://sitonggong.github.io/EgoServe-page/{Vinci2}.
English
When should an intelligent assistant speak up without being asked? Continuous egocentric video offers rich, evolving context that enables a new form of assistance: one that is proactive rather than merely reactive. Yet existing approaches either wait passively for user queries or treat every detected event as requiring a response, without considering the user's history, current activity, or whether assistance would actually be welcome. We reframe proactive assistance as a context-dependent decision problem: the agent must not only perceive what is happening, but reason over accumulated temporal context to determine when and whether to intervene. To this end, we present Vinci2, a proactive egocentric assistance system that advances the on-device assistant Vinci from reactive response toward proactivity. On the evaluation side, we present EgoServe, the first large-scale benchmark for proactive assistance in continuous egocentric video. EgoServe comprises over 3,000 service instances organized along 4 temporal memory horizons, ranging from immediate safety alerts to long-term habit coaching, across 10 service categories. On the modeling side, we propose EgoMemo, a training-free, memory-augmented agent that maintains three complementary memory representations: multi-scale temporal summaries, a semantic knowledge graph, and visual embedding archives. At each timestep, EgoMemo performs retrieval-augmented reasoning to determine whether assistance is warranted and, if so, produces contextually grounded responses. Experiments demonstrate that EgoMemo establishes strong baselines on EgoServe while remaining competitive on existing egocentric benchmarks. Our benchmark and code are publicly available at https://sitonggong.github.io/EgoServe-page/{Vinci2}.