Vinci2: Предоставление проактивной помощи в непрерывных эгоцентрических видео
Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos
July 13, 2026
Авторы: Gong Sitong, Tianyu Yan, Caixin Kang, Bo Zheng, Xiang Ruan, Huchuan Lu, Kaipeng Zhang, Yoichi Sato, Yifei Huang
cs.AI
Аннотация
Когда умный помощник должен заговорить без запроса? Непрерывное эгоцентрическое видео предоставляет богатый, постоянно меняющийся контекст, открывающий новую форму помощи: проактивную, а не просто реактивную. Однако существующие подходы либо пассивно ждут запросов пользователя, либо реагируют на каждое обнаруженное событие, не принимая во внимание историю пользователя, его текущую деятельность или то, будет ли помощь действительно уместна. Мы переосмысливаем проактивную помощь как проблему принятия решений с учетом контекста: агент должен не только воспринимать происходящее, но и анализировать накопленный временной контекст, чтобы определить, когда и стоит ли вмешиваться. Для этого мы представляем Vinci2 — проактивную систему эгоцентрической помощи, которая развивает бортовой помощник Vinci от реактивного реагирования к проактивности. Для оценки мы представляем EgoServe — первый крупномасштабный бенчмарк для проактивной помощи в непрерывном эгоцентрическом видео. EgoServe включает более 3000 сервисных экземпляров, организованных по четырем временным горизонтам памяти — от немедленных оповещений о безопасности до долгосрочного коучинга привычек — в 10 категориях услуг. Для моделирования мы предлагаем EgoMemo — агент без обучения с дополненной памятью, который поддерживает три взаимодополняющих представления памяти: многомасштабные временные сводки, семантический граф знаний и архивы визуальных вложений. На каждом временном шаге EgoMemo выполняет рассуждения с дополнением на основе поиска, чтобы определить, обоснована ли помощь, и если да, то генерирует контекстуально обоснованные ответы. Эксперименты показывают, что EgoMemo устанавливает надежные базовые показатели на EgoServe, оставаясь конкурентоспособным на существующих эгоцентрических бенчмарках. Наш бенчмарк и код доступны по адресу https://sitonggong.github.io/EgoServe-page/{Vinci2}.
English
When should an intelligent assistant speak up without being asked? Continuous egocentric video offers rich, evolving context that enables a new form of assistance: one that is proactive rather than merely reactive. Yet existing approaches either wait passively for user queries or treat every detected event as requiring a response, without considering the user's history, current activity, or whether assistance would actually be welcome. We reframe proactive assistance as a context-dependent decision problem: the agent must not only perceive what is happening, but reason over accumulated temporal context to determine when and whether to intervene. To this end, we present Vinci2, a proactive egocentric assistance system that advances the on-device assistant Vinci from reactive response toward proactivity. On the evaluation side, we present EgoServe, the first large-scale benchmark for proactive assistance in continuous egocentric video. EgoServe comprises over 3,000 service instances organized along 4 temporal memory horizons, ranging from immediate safety alerts to long-term habit coaching, across 10 service categories. On the modeling side, we propose EgoMemo, a training-free, memory-augmented agent that maintains three complementary memory representations: multi-scale temporal summaries, a semantic knowledge graph, and visual embedding archives. At each timestep, EgoMemo performs retrieval-augmented reasoning to determine whether assistance is warranted and, if so, produces contextually grounded responses. Experiments demonstrate that EgoMemo establishes strong baselines on EgoServe while remaining competitive on existing egocentric benchmarks. Our benchmark and code are publicly available at https://sitonggong.github.io/EgoServe-page/{Vinci2}.