ChatPaper.aiChatPaper

AgenticSTS: Een testbed met begrensd geheugen voor LLM-agenten met een lange horizon

AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents

July 2, 2026
Auteurs: Xiangchen Cheng, Yunwei Jiang, Jianwen Sun, Zizhen Li, Chuanhao Li, Xiangcheng Cao, Yihao Liu, Fanrui Zhang, Li Jin, Kaipeng Zhang
cs.AI

Samenvatting

Geheugen voor een LLM-agent met een lange horizon is een contract over wat elke toekomstige beslissing mag zien. Het eenvoudigste contract voegt eerdere observaties, tool-aanroepen en reflecties toe aan elke prompt, wat eerdere context gemakkelijk toegankelijk maakt, maar het ook verandert in een door elkaar geraakt mengsel waarin het effect van een enkele geheugencomponent moeilijk te isoleren is. We introduceren en instrumenteren een alternatief begrensd contract: elke beslissing wordt genomen op basis van een nieuw gebruikersbericht dat is samengesteld via getypeerde terugvinding, zonder dat er een ruw transcript over beslissingen wordt toegevoegd. De prompt blijft daardoor begrensd over runs van elke lengte, en elke afzonderlijke laag kan geïsoleerd worden geablateerd. We instantiëren het contract in Slay the Spire 2, een gesloten-regel stochastisch deck-building-spel waarvan de runs honderden tactische en strategische beslissingen vereisen. Een openbare online benchmark van frontier LLM's op hetzelfde spel rapporteert nul overwinningen op de laagste moeilijkheidsgraad over vijf configuraties, en het door de ontwikkelaar gerapporteerde menselijke winstpercentage op dezelfde moeilijkheidsgraad is 16%; de taak is moeilijk maar niet verzadigd. Binnen onze harness toont een vaste A0-ablatie het grootste waargenomen verschil wanneer geactiveerde strategische vaardigheden zijn ingeschakeld: de no-store baseline wint 3/10 spellen en het toevoegen van de vaardighedenlaag 6/10. Bij deze steekproefgrootte is de vergelijking directioneel in plaats van statistisch doorslaggevend (Fisher exact p≈0,37); een cross-backbone-probe en openbare accumulerende-context-baselines worden gerapporteerd als operationele vergelijkingen in plaats van gecontroleerde tests van de contractvariabele zelf. We brengen een reproduceerbare testomgeving uit: 298 voltooide trajecten met conditietags, bevroren geheugen/vaardigheid-snapshots, promptrecords en analysescripts — een agentontwerp en een gevalideerde, herbruikbare methodologie voor het bestuderen van hoe expliciete geheugenlagen langetermijnbeslissingen van LLM-agenten vormgeven.
English
Memory for a long-horizon LLM agent is a contract about what each future decision is allowed to see. The simplest contract appends past observations, tool calls, and reflections to every prompt, which makes prior context easy to access but also turns it into a jumbled mixture in which the effect of any single memory component is hard to isolate. We introduce and instrument an alternative bounded contract: every decision is made from a fresh user message assembled by typed retrieval, with no raw cross-decision transcript appended. The prompt thus stays bounded across runs of any length, and any single layer can be ablated in isolation. We instantiate the contract in Slay the Spire 2, a closed-rule stochastic deck-building game whose runs require hundreds of tactical and strategic decisions. A public online benchmark of frontier LLMs on the same game reports zero wins at the lowest difficulty across five configurations, and the developer-reported human win rate at the same difficulty is 16%; the task is hard but not saturated. Within our harness, a fixed-A0 ablation shows the largest observed difference when triggered strategic skills are enabled: the no-store baseline wins 3/10 games and adding the skill layer 6/10. At this sample size the comparison is directional rather than statistically decisive (Fisher exact p\approx0.37); a cross-backbone probe and public accumulating-context baselines are reported as operational comparisons rather than controlled tests of the contract variable itself. We release a reproducible testbed: 298 completed trajectories with condition tags, frozen memory/skill snapshots, prompt records, and analysis scripts -- an agent design and a validated, reusable methodology for studying how explicit memory layers shape long-horizon LLM-agent decisions.