Se souvenir quand cela compte : Agent mémoire proactif pour agents à long horizon
Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents
July 9, 2026
Auteurs: Yifan Wu, Lizhu Zhang, Yuhang Zhou, Mingyi Wang, Bo Peng, Serena Li, Xiangjun Fan, Zhuokai Zhao
cs.AI
Résumé
Dans les tâches à long horizon, l'état pertinent pour la décision est souvent dispersé sur une trajectoire en expansion, tandis que l'agent d'action doit le faire émerger et agir. À mesure que les trajectoires s'allongent, les exigences de la tâche, les faits de l'environnement, les tentatives précédentes, les diagnostics et les sous-objectifs ouverts peuvent être enfouis dans la fenêtre de contexte ou repoussés au-delà, n'influençant pas les décisions lorsque nécessaire. Nous appelons ce mode de défaillance « décroissance de l'état comportemental ». Nous étudions la mémoire comme un mécanisme d'intervention active plutôt que de récupération passive. Un agent mémoire séparé s'exécute parallèlement à un agent d'action non modifié, mettant à jour une banque de mémoire structurée à partir de la trajectoire récente et décidant d'injecter un rappel ancré dans la mémoire ou de rester silencieux. Le module est prêt à l'emploi avec les agents d'action de pointe et les infrastructures d'agents existantes. Sur Terminal-Bench 2.0 et τ^2-Bench, il améliore le pass@1 pour les agents d'action aussi bien faibles que forts, avec des gains de +8,3 points de pourcentage sur Terminal-Bench et +6,8 points de pourcentage sur τ^2-Bench. Les ablations montrent que l'intervention sélective surpasse l'exposition passive à la banque, l'injection en continu, le guidage par simple conseiller et la récupération générale. En tant que premier pas vers des politiques mémoire à poids ouverts, nous entraînons Qwen3.5-27B sur SETA en utilisant SFT et GRPO, améliorant la récompense de validation et obtenant un transfert partiel vers Terminal-Bench.
English
In long-horizon tasks, decision-relevant state is often scattered across an expanding trajectory, while the action agent must surface it and act. As trajectories grow, task requirements, environment facts, prior attempts, diagnoses, and open subgoals can be buried in the context window or pushed beyond it, failing to influence decisions when needed. We call this failure mode "behavioral state decay". We study memory as an active intervention mechanism rather than passive retrieval. A separate memory agent runs alongside an unmodified action agent, updating a structured memory bank from the recent trajectory and deciding whether to inject a memory-grounded reminder or remain silent. The module is plug-and-play with frontier action agents and existing agent harnesses. Across Terminal-Bench 2.0 and τ^2-Bench, it improves pass@1 for both weaker and stronger action agents, with gains of +8.3 pp on Terminal-Bench and +6.8 pp on τ^2-Bench. Ablations show that selective intervention outperforms passive bank exposure, always-on injection, advisor-only guidance, and general retrieval. As an early step toward open-weight memory policies, we train Qwen3.5-27B on SETA using SFT and GRPO, improving validation reward and achieving partial transfer to Terminal-Bench.