ChatPaper.aiChatPaper

Continual Harness: Adaptação Online para Agentes de Base Auto-Melhoráveis

Continual Harness: Online Adaptation for Self-Improving Foundation Agents

May 11, 2026
Autores: Seth Karten, Joel Zhang, Tersoo Upaa Jr, Ruirong Feng, Wenzhe Li, Chengshuai Shi, Chi Jin, Kiran Vodrahalli
cs.AI

Resumo

Estruturas de codificação como Claude Code e OpenHands envolvem modelos de base com ferramentas, memória e planejamento, mas não existe equivalente para a tomada de decisão com horizonte longo e observabilidade parcial de agentes incorporados. Primeiramente, relatamos nossos experimentos Gemini Plays Pokemon (GPP). Com refinamento iterativo da estrutura com intervenção humana no circuito, o GPP tornou-se o primeiro sistema de IA a completar Pokemon Blue, Yellow Legacy no modo difícil e Crystal sem derrotas. Nas fases mais difíceis, o próprio agente começou a iterar sobre sua estratégia por meio de memória de contexto longo, revelando sinais emergentes de autoaperfeiçoamento juntamente com o refinamento com intervenção humana. O Continual Harness remove completamente o humano desse circuito: uma estrutura autoaperfeiçoável sem reset para agentes incorporados que formaliza e automatiza o que observamos. Partindo apenas de uma interface mínima de ambiente, o agente alterna entre agir e refinar seu próprio prompt, subagentes, habilidades e memória, utilizando quaisquer dados de trajetórias passadas. Métodos de otimização de prompt exigem resets de episódio; o Continual Harness se adapta online em uma única execução. Em Pokemon Red e Emerald, em modelos de fronteira, o Continual Harness partindo do zero reduz substancialmente o custo de pressionamento de botão em relação à linha de base minimalista e recupera a maior parte da diferença para uma estrutura especialista projetada manualmente, com ganhos dependentes da capacidade, apesar de partir da mesma interface bruta, sem conhecimento selecionado, ferramentas artesanais ou arcabouço de domínio. Em seguida, fechamos o circuito com o próprio modelo: um ciclo de co-aprendizagem de processo-recompensa online, no qual as execuções de um agente de código aberto através da estrutura de refinamento são reetiquetadas por um professor de fronteira e usadas para atualizar o modelo, impulsionando progresso sustentado em marcos do jogo em Pokemon Red sem resetar o ambiente entre as iterações de treinamento.
English
Coding harnesses such as Claude Code and OpenHands wrap foundation models with tools, memory, and planning, but no equivalent exists for embodied agents' long-horizon partial-observability decision-making. We first report our Gemini Plays Pokemon (GPP) experiments. With iterative human-in-the-loop harness refinement, GPP became the first AI system to complete Pokemon Blue, Yellow Legacy on hard mode, and Crystal without a lost battle. In the hardest stages, the agent itself began iterating on its strategy through long-context memory, surfacing emergent self-improvement signals alongside human-in-the-loop refinement. Continual Harness removes the human fully from this loop: a reset-free self-improving harness for embodied agents that formalizes and automates what we observed. Starting from only a minimal environment interface, the agent alternates between acting and refining its own prompt, sub-agents, skills, and memory, drawing on any past trajectory data. Prompt-optimization methods require episode resets; Continual Harness adapts online within a single run. On Pokemon Red and Emerald across frontier models, Continual Harness starting from scratch substantially reduces button-press cost relative to the minimalist baseline and recovers a majority of the gap to a hand-engineered expert harness, with capability-dependent gains, despite starting from the same raw interface with no curated knowledge, no hand-crafted tools, and no domain scaffolding. We then close the loop with the model itself: an online process-reward co-learning loop, in which an open-source agent's rollouts through the refining harness are relabeled by a frontier teacher and used to update the model, drives sustained in-game milestone progress on Pokemon Red without resetting the environment between training iterations.