ChatPaper.aiChatPaper

Onthoud Wanneer Het Ertoe Doet: Proactieve Geheugenagent voor Langetermijnagenten

Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents

July 9, 2026
Auteurs: Yifan Wu, Lizhu Zhang, Yuhang Zhou, Mingyi Wang, Bo Peng, Serena Li, Xiangjun Fan, Zhuokai Zhao
cs.AI

Samenvatting

Bij langetermijntaken is de beslissingsrelevante toestand vaak verspreid over een uitdijend traject, terwijl de actie-agent deze moet bovenhalen en ernaar moet handelen. Naarmate trajecten langer worden, kunnen taakvereisten, omgevingsfeiten, eerdere pogingen, diagnoses en openstaande subdoelen worden begraven in het contextvenster of erbuiten worden geduwd, waardoor ze niet op het juiste moment de besluitvorming beïnvloeden. We noemen deze storingsmodus "verval van gedragstoestand". We bestuderen geheugen als een actief interventiemechanisme in plaats van passieve ophaling. Een aparte geheugenagent draait naast een ongewijzigde actie-agent, werkt een gestructureerd geheugenbestand bij op basis van het recente traject en beslist of een op het geheugen gebaseerde herinnering moet worden geïnjecteerd of dat er moet worden gezwegen. De module is plug-and-play met geavanceerde actie-agenten en bestaande agentkaders. In Terminal-Bench 2.0 en τ^2-Bench verbetert het de pass@1 voor zowel zwakkere als sterkere actie-agenten, met winsten van +8,3 procentpunt op Terminal-Bench en +6,8 procentpunt op τ^2-Bench. Ablatiestudies tonen aan dat selectieve interventie beter presteert dan passieve blootstelling aan het geheugenbestand, altijd aanstaande injectie, alleen adviserende begeleiding en algemene ophaling. Als een vroege stap in de richting van open-gewicht geheugenbeleid trainen we Qwen3.5-27B op SETA met SFT en GRPO, wat de validatiebeloning verbetert en gedeeltelijke overdracht naar Terminal-Bench bewerkstelligt.
English
In long-horizon tasks, decision-relevant state is often scattered across an expanding trajectory, while the action agent must surface it and act. As trajectories grow, task requirements, environment facts, prior attempts, diagnoses, and open subgoals can be buried in the context window or pushed beyond it, failing to influence decisions when needed. We call this failure mode "behavioral state decay". We study memory as an active intervention mechanism rather than passive retrieval. A separate memory agent runs alongside an unmodified action agent, updating a structured memory bank from the recent trajectory and deciding whether to inject a memory-grounded reminder or remain silent. The module is plug-and-play with frontier action agents and existing agent harnesses. Across Terminal-Bench 2.0 and τ^2-Bench, it improves pass@1 for both weaker and stronger action agents, with gains of +8.3 pp on Terminal-Bench and +6.8 pp on τ^2-Bench. Ablations show that selective intervention outperforms passive bank exposure, always-on injection, advisor-only guidance, and general retrieval. As an early step toward open-weight memory policies, we train Qwen3.5-27B on SETA using SFT and GRPO, improving validation reward and achieving partial transfer to Terminal-Bench.