ChatPaper.aiChatPaper

Помни, когда это важно: Проактивный агент памяти для долгосрочных агентов

Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents

July 9, 2026
Авторы: Yifan Wu, Lizhu Zhang, Yuhang Zhou, Mingyi Wang, Bo Peng, Serena Li, Xiangjun Fan, Zhuokai Zhao
cs.AI

Аннотация

В задачах с длинным горизонтом релевантное для принятия решений состояние часто разбросано по расширяющейся траектории, тогда как агент действий должен извлечь его и действовать. По мере роста траекторий требования задачи, факты среды, предыдущие попытки, диагнозы и открытые подцели могут быть погребены в окне контекста или вытеснены за его пределы, не оказывая влияния на решения, когда это необходимо. Мы называем этот режим отказа «затуханием поведенческого состояния». Мы изучаем память как механизм активного вмешательства, а не пассивного извлечения. Отдельный агент памяти работает вместе с неизменным агентом действий, обновляя структурированное хранилище памяти на основе недавней траектории и принимая решение о том, следует ли внедрить напоминание, основанное на памяти, или оставаться в бездействии. Модуль подключается и работает с передовыми агентами действий и существующими обвязками агентов. На Terminal-Bench 2.0 и τ^2-Bench он улучшает pass@1 как для более слабых, так и для более сильных агентов действий, с приростами в +8,3 п.п. на Terminal-Bench и +6,8 п.п. на τ^2-Bench. Абляции показывают, что селективное вмешательство превосходит пассивное использование банка, постоянное внедрение, только советующее руководство и общее извлечение. В качестве первого шага к политикам памяти с открытыми весами мы обучаем Qwen3.5-27B на SETA с помощью SFT и GRPO, улучшая валидационное вознаграждение и достигая частичного переноса на Terminal-Bench.
English
In long-horizon tasks, decision-relevant state is often scattered across an expanding trajectory, while the action agent must surface it and act. As trajectories grow, task requirements, environment facts, prior attempts, diagnoses, and open subgoals can be buried in the context window or pushed beyond it, failing to influence decisions when needed. We call this failure mode "behavioral state decay". We study memory as an active intervention mechanism rather than passive retrieval. A separate memory agent runs alongside an unmodified action agent, updating a structured memory bank from the recent trajectory and deciding whether to inject a memory-grounded reminder or remain silent. The module is plug-and-play with frontier action agents and existing agent harnesses. Across Terminal-Bench 2.0 and τ^2-Bench, it improves pass@1 for both weaker and stronger action agents, with gains of +8.3 pp on Terminal-Bench and +6.8 pp on τ^2-Bench. Ablations show that selective intervention outperforms passive bank exposure, always-on injection, advisor-only guidance, and general retrieval. As an early step toward open-weight memory policies, we train Qwen3.5-27B on SETA using SFT and GRPO, improving validation reward and achieving partial transfer to Terminal-Bench.