ChatPaper.aiChatPaper

Planos Não Persistem: Por que o Gerenciamento de Contexto é Essencial para Agentes de LLM

Plans Don't Persist: Why Context Management Is Load Bearing for LLM Agents

June 22, 2026
Autores: Aman Mehta, Anupam Datta
cs.AI

Resumo

Agentes de longo horizonte dependem de gerenciamento de contexto: sistemas comprimem, resumem e removem tokens antigos para que as tarefas possam continuar além de janelas finitas. Isso só é seguro quando as informações descartadas não são mais necessárias ou foram internalizadas. Planos são o caso crítico: são escritos no início, usados por muitas etapas e os primeiros a serem removidos. Introduzimos o pareamento de replay, um diagnóstico que executa a mesma trajetória com e sem o plano no histórico e mede a distância de cosseno do estado oculto. No Llama-3.1-70B, o sinal do plano atinge pico de 0,453 uma etapa após o plano, caindo 4,1x em uma única etapa de ação-observação; o HotpotQA cai 12,4x. Isso é evidência de que agentes LLM padrão não transportam planos adiante como estado persistente, e dependem, em vez disso, de que o plano permaneça no contexto. Uma sonda na camada L32 detecta essa degradação como diagnóstico, não como prova de que ela lê o conteúdo do plano em si. Modelos de raciocínio adicionam um confundidor de medição: seus traços `<think>` rederivam o conteúdo do plano, de modo que a remoção padrão deixa evidência do plano na condição sem plano. Denominamos isso de confusão do traço de raciocínio e a corrigimos com remoção estrita, que remove blocos `<think>` anteriores apenas da execução sem plano. Isso recupera +163% do sinal da etapa+1 na amostra e +153% fora da amostra, enquanto não altera significativamente o Llama não raciocinante (+4,8%). No DeepSeek-R1-Distill-Llama-70B, uma sonda treinada no Llama transfere com AUROC 0,748 (p=6e-4), enquanto sondas específicas para R1 atingem 1,000, sugerindo que o R1 codifica o sinal do plano em uma direção diferente do estado oculto. Por fim, um teste de estresse de compressão mostra o custo prático: a remoção ingênua do plano reduz o sucesso no ALFWorld em 34,7pp, enquanto o re-surgimento controlado por sonda não o recupera. A contribuição é uma estrutura de medição e teste de estresse que mostra que informações críticas para o agente podem ser residentes no contexto, e não persistentes. O gerenciamento de contexto é essencial, mas apenas a proteção do plano não é suficiente.
English
Long-horizon agents depend on context management: systems compress, summarize, and evict old tokens so tasks can continue beyond finite windows. That is safe only when dropped information is no longer needed or has been internalized. Plans are the stress case: they are written early, used for many steps, and first to be evicted. We introduce replay pairing, a diagnostic that runs the same trajectory with and without the plan in history and measures hidden-state cosine distance. On Llama-3.1-70B, plan signal spikes to 0.453 one step after the plan, then falls 4.1x in a single action-observation step; HotpotQA falls 12.4x. This is evidence that standard LLM agents do not carry plans forward as persistent state, and instead depend on the plan remaining in context. A layer-L32 probe detects this decay as a diagnostic, not as proof that it reads plan content itself. Reasoning models add a measurement confound: their `<think>` traces re-derive plan content, so standard stripping leaves plan evidence in the stripped condition. We name this the reasoning-trace confound and fix it with strict stripping, which removes prior `<think>` blocks from the stripped run only. It recovers +163% of the step+1 signal in-sample and +153% held out, while not meaningfully changing non-reasoning Llama (+4.8%). On DeepSeek-R1-Distill-Llama-70B, a Llama-trained probe transfers at AUROC 0.748 (p=6e-4), while R1-specific probes reach 1.000, suggesting R1 encodes plan signal in a different hidden-state direction. Finally, a compression stress test shows the practical cost: naive plan eviction cuts ALFWorld success by 34.7pp, while probe-gated re-surfacing does not recover it. The contribution is a measurement and stress-test framework showing that agent-critical information can be context-resident rather than persistent. Context management is load bearing, but plan protection alone is not enough.