ChatPaper.aiChatPaper

AgenticSTS: Um Ambiente de Teste de Memória Limitada para Agentes de LLM de Longo Horizonte

AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents

July 2, 2026
Autores: Xiangchen Cheng, Yunwei Jiang, Jianwen Sun, Zizhen Li, Chuanhao Li, Xiangcheng Cao, Yihao Liu, Fanrui Zhang, Li Jin, Kaipeng Zhang
cs.AI

Resumo

A memória para um agente LLM de longo horizonte é um contrato sobre o que cada decisão futura pode ver. O contrato mais simples anexa observações passadas, chamadas de ferramentas e reflexões a cada prompt, o que facilita o acesso ao contexto anterior, mas também o transforma em uma mistura confusa na qual o efeito de qualquer componente único de memória é difícil de isolar. Introduzimos e instrumentamos um contrato limitado alternativo: cada decisão é tomada a partir de uma nova mensagem de usuário montada por recuperação tipada, sem qualquer transcrição bruta entre decisões anexada. O prompt permanece, portanto, limitado ao longo de execuções de qualquer duração, e qualquer camada isolada pode ser removida experimentalmente de forma independente. Implementamos o contrato em *Slay the Spire 2*, um jogo estocástico de construção de baralho com regras fechadas, cujas partidas exigem centenas de decisões táticas e estratégicas. Um benchmark público online de LLMs de fronteira no mesmo jogo relata zero vitórias na dificuldade mais baixa em cinco configurações, e a taxa de vitórias humana relatada pelo desenvolvedor na mesma dificuldade é de 16%; a tarefa é difícil, mas não saturada. Dentro do nosso arcabouço, uma ablação de A0 fixo mostra a maior diferença observada quando habilidades estratégicas acionadas são ativadas: a linha de base sem armazenamento vence 3/10 jogos e, ao adicionar a camada de habilidades, 6/10. Nesse tamanho amostral, a comparação é direcional, e não estatisticamente decisiva (p exato de Fisher ≈ 0,37); uma sonda intercruzamento de arquiteturas e linhas de base públicas de contexto acumulativo são relatadas como comparações operacionais, e não como testes controlados da própria variável do contrato. Disponibilizamos um ambiente de teste reproduzível: 298 trajetórias concluídas com marcadores de condição, instantâneos congelados de memória/habilidades, registros de prompts e scripts de análise — um projeto de agente e uma metodologia validada e reutilizável para estudar como camadas explícitas de memória moldam as decisões de agentes LLM de longo horizonte.
English
Memory for a long-horizon LLM agent is a contract about what each future decision is allowed to see. The simplest contract appends past observations, tool calls, and reflections to every prompt, which makes prior context easy to access but also turns it into a jumbled mixture in which the effect of any single memory component is hard to isolate. We introduce and instrument an alternative bounded contract: every decision is made from a fresh user message assembled by typed retrieval, with no raw cross-decision transcript appended. The prompt thus stays bounded across runs of any length, and any single layer can be ablated in isolation. We instantiate the contract in Slay the Spire 2, a closed-rule stochastic deck-building game whose runs require hundreds of tactical and strategic decisions. A public online benchmark of frontier LLMs on the same game reports zero wins at the lowest difficulty across five configurations, and the developer-reported human win rate at the same difficulty is 16%; the task is hard but not saturated. Within our harness, a fixed-A0 ablation shows the largest observed difference when triggered strategic skills are enabled: the no-store baseline wins 3/10 games and adding the skill layer 6/10. At this sample size the comparison is directional rather than statistically decisive (Fisher exact p\approx0.37); a cross-backbone probe and public accumulating-context baselines are reported as operational comparisons rather than controlled tests of the contract variable itself. We release a reproducible testbed: 298 completed trajectories with condition tags, frozen memory/skill snapshots, prompt records, and analysis scripts -- an agent design and a validated, reusable methodology for studying how explicit memory layers shape long-horizon LLM-agent decisions.