ChatPaper.aiChatPaper

Vinci2: Bereitstellung proaktiver Unterstützung in kontinuierlichen egozentrischen Videos

Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos

July 13, 2026
Autoren: Gong Sitong, Tianyu Yan, Caixin Kang, Bo Zheng, Xiang Ruan, Huchuan Lu, Kaipeng Zhang, Yoichi Sato, Yifei Huang
cs.AI

Zusammenfassung

Wann sollte ein intelligenter Assistent von sich aus das Wort ergreifen, ohne dass man ihn darum bittet? Kontinuierliche egozentrische Videos bieten einen reichhaltigen, sich ständig verändernden Kontext, der eine neue Form der Assistenz ermöglicht: eine, die proaktiv und nicht nur reaktiv ist. Dennoch warten bestehende Ansätze entweder passiv auf Benutzeranfragen oder behandeln jedes erkannte Ereignis als Aufforderung zu einer Reaktion, ohne die Vorgeschichte des Benutzers, seine aktuelle Aktivität oder die Frage zu berücksichtigen, ob Hilfe überhaupt willkommen wäre. Wir definieren proaktive Assistenz neu als ein kontextabhängiges Entscheidungsproblem: Der Agent muss nicht nur wahrnehmen, was passiert, sondern über den angesammelten zeitlichen Kontext nachdenken, um zu bestimmen, wann und ob er eingreifen soll. Zu diesem Zweck präsentieren wir Vinci2, ein proaktives egozentrisches Assistenzsystem, das den On-Device-Assistenten Vinci von einer reaktiven Antwort hin zur Proaktivität weiterentwickelt. Auf der Evaluierungsseite stellen wir EgoServe vor, den ersten groß angelegten Benchmark für proaktive Assistenz in kontinuierlichen egozentrischen Videos. EgoServe umfasst über 3.000 Service-Instanzen, die entlang von 4 zeitlichen Gedächtnishorizonten organisiert sind – von unmittelbaren Sicherheitswarnungen bis hin zu langfristigem Gewohnheitstraining – und deckt 10 Servicekategorien ab. Auf der Modellierungsseite schlagen wir EgoMemo vor, einen trainierenden, gedächtniserweiterten Agenten, der drei komplementäre Gedächtnisrepräsentationen unterhält: mehrskalige zeitliche Zusammenfassungen, einen semantischen Wissensgraphen und Archive visueller Einbettungen. Zu jedem Zeitschritt führt EgoMemo eine retrieval-gestützte Argumentation durch, um zu bestimmen, ob eine Assistenz gerechtfertigt ist, und erzeugt gegebenenfalls kontextuell fundierte Antworten. Experimente zeigen, dass EgoMemo starke Baselines auf EgoServe etabliert und gleichzeitig auf bestehenden egozentrischen Benchmarks wettbewerbsfähig bleibt. Unser Benchmark und Code sind öffentlich verfügbar unter https://sitonggong.github.io/EgoServe-page/{Vinci2}.
English
When should an intelligent assistant speak up without being asked? Continuous egocentric video offers rich, evolving context that enables a new form of assistance: one that is proactive rather than merely reactive. Yet existing approaches either wait passively for user queries or treat every detected event as requiring a response, without considering the user's history, current activity, or whether assistance would actually be welcome. We reframe proactive assistance as a context-dependent decision problem: the agent must not only perceive what is happening, but reason over accumulated temporal context to determine when and whether to intervene. To this end, we present Vinci2, a proactive egocentric assistance system that advances the on-device assistant Vinci from reactive response toward proactivity. On the evaluation side, we present EgoServe, the first large-scale benchmark for proactive assistance in continuous egocentric video. EgoServe comprises over 3,000 service instances organized along 4 temporal memory horizons, ranging from immediate safety alerts to long-term habit coaching, across 10 service categories. On the modeling side, we propose EgoMemo, a training-free, memory-augmented agent that maintains three complementary memory representations: multi-scale temporal summaries, a semantic knowledge graph, and visual embedding archives. At each timestep, EgoMemo performs retrieval-augmented reasoning to determine whether assistance is warranted and, if so, produces contextually grounded responses. Experiments demonstrate that EgoMemo establishes strong baselines on EgoServe while remaining competitive on existing egocentric benchmarks. Our benchmark and code are publicly available at https://sitonggong.github.io/EgoServe-page/{Vinci2}.