ChatPaper.aiChatPaper

Recuerda Cuando Importa: Agente de Memoria Proactivo para Agentes de Horizonte Largo

Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents

July 9, 2026
Autores: Yifan Wu, Lizhu Zhang, Yuhang Zhou, Mingyi Wang, Bo Peng, Serena Li, Xiangjun Fan, Zhuokai Zhao
cs.AI

Resumen

En tareas de horizonte largo, el estado relevante para la decisión suele estar disperso a lo largo de una trayectoria en expansión, mientras que el agente de acción debe sacarlo a la superficie y actuar. A medida que las trayectorias se alargan, los requisitos de la tarea, los hechos del entorno, los intentos previos, los diagnósticos y los subobjetivos abiertos pueden quedar sepultados en la ventana de contexto o ser empujados más allá de ella, sin lograr influir en las decisiones cuando se necesitan. Denominamos a este modo de fallo "decaimiento del estado conductual". Estudiamos la memoria como un mecanismo de intervención activa, no como una recuperación pasiva. Un agente de memoria independiente opera junto a un agente de acción no modificado, actualizando un banco de memoria estructurada a partir de la trayectoria reciente y decidiendo si inyectar un recordatorio basado en la memoria o permanecer en silencio. El módulo es plug-and-play con agentes de acción de vanguardia y plataformas de agentes existentes. En Terminal-Bench 2.0 y τ²-Bench, mejora el pass@1 tanto para agentes de acción más débiles como más fuertes, con ganancias de +8.3 pp en Terminal-Bench y +6.8 pp en τ²-Bench. Las ablationes muestran que la intervención selectiva supera a la exposición pasiva al banco, la inyección siempre activa, la guía solo de asesor y la recuperación general. Como paso inicial hacia políticas de memoria de pesos abiertos, entrenamos Qwen3.5-27B en SETA usando SFT y GRPO, mejorando la recompensa de validación y logrando una transferencia parcial a Terminal-Bench.
English
In long-horizon tasks, decision-relevant state is often scattered across an expanding trajectory, while the action agent must surface it and act. As trajectories grow, task requirements, environment facts, prior attempts, diagnoses, and open subgoals can be buried in the context window or pushed beyond it, failing to influence decisions when needed. We call this failure mode "behavioral state decay". We study memory as an active intervention mechanism rather than passive retrieval. A separate memory agent runs alongside an unmodified action agent, updating a structured memory bank from the recent trajectory and deciding whether to inject a memory-grounded reminder or remain silent. The module is plug-and-play with frontier action agents and existing agent harnesses. Across Terminal-Bench 2.0 and τ^2-Bench, it improves pass@1 for both weaker and stronger action agents, with gains of +8.3 pp on Terminal-Bench and +6.8 pp on τ^2-Bench. Ablations show that selective intervention outperforms passive bank exposure, always-on injection, advisor-only guidance, and general retrieval. As an early step toward open-weight memory policies, we train Qwen3.5-27B on SETA using SFT and GRPO, improving validation reward and achieving partial transfer to Terminal-Bench.