Continu Harnas: Online Aanpassing voor Zelfverbeterende Basisagenten
Continual Harness: Online Adaptation for Self-Improving Foundation Agents
May 11, 2026
Auteurs: Seth Karten, Joel Zhang, Tersoo Upaa Jr, Ruirong Feng, Wenzhe Li, Chengshuai Shi, Chi Jin, Kiran Vodrahalli
cs.AI
Samenvatting
Codeerharnessen zoals Claude Code en OpenHands wikkelen fundamentmodellen in met tools, geheugen en planning, maar er bestaat geen equivalent voor de besluitvorming over lange horizon met gedeeltelijke waarneembaarheid van belichaamde agenten. We rapporteren eerst onze Gemini Plays Pokemon (GPP)-experimenten. Met iteratieve verfijning van de harness met een mens-in-de-lus werd GPP het eerste AI-systeem dat Pokemon Blue, Yellow Legacy op harde modus en Crystal voltooide zonder een verloren gevecht. In de moeilijkste stadia begon de agent zelf zijn strategie te itereren via langetermijngeheugen, waarbij opkomende zelfverbeteringssignalen naar boven kwamen naast verfijning met een mens-in-de-lus. Continual Harness verwijdert de mens volledig uit deze lus: een reset-vrije zelfverbeterende harness voor belichaamde agenten die wat we hebben waargenomen formaliseert en automatiseert. Uitgaande van slechts een minimale omgevingsinterface, wisselt de agent af tussen handelen en het verfijnen van zijn eigen prompt, sub-agenten, vaardigheden en geheugen, daarbij puttend uit eerdere trajectgegevens. Prompt-optimalisatiemethoden vereisen episode-resets; Continual Harness past zich online aan binnen een enkele run. Op Pokemon Red en Emerald met frontier-modellen vermindert Continual Harness, vanaf nul beginnend, de knopdrukkosten aanzienlijk ten opzichte van de minimalistische basislijn en overbrugt het een groot deel van de kloof naar een handmatig ontworpen expert harness, met capaciteitsafhankelijke winsten, ondanks dat het uitgaat van dezelfde ruwe interface zonder samengestelde kennis, zonder handgemaakte tools en zonder domeinondersteuning. Vervolgens sluiten we de lus met het model zelf: een online proces-beloning co-leerlus, waarin de rollouts van een open-source agent door de verfijnende harness worden herlabeld door een frontier-leraar en gebruikt om het model bij te werken, leidt tot aanhoudende in-game mijlpaalvooruitgang op Pokemon Red zonder de omgeving te resetten tussen trainingsiteraties.
English
Coding harnesses such as Claude Code and OpenHands wrap foundation models with tools, memory, and planning, but no equivalent exists for embodied agents' long-horizon partial-observability decision-making. We first report our Gemini Plays Pokemon (GPP) experiments. With iterative human-in-the-loop harness refinement, GPP became the first AI system to complete Pokemon Blue, Yellow Legacy on hard mode, and Crystal without a lost battle. In the hardest stages, the agent itself began iterating on its strategy through long-context memory, surfacing emergent self-improvement signals alongside human-in-the-loop refinement. Continual Harness removes the human fully from this loop: a reset-free self-improving harness for embodied agents that formalizes and automates what we observed. Starting from only a minimal environment interface, the agent alternates between acting and refining its own prompt, sub-agents, skills, and memory, drawing on any past trajectory data. Prompt-optimization methods require episode resets; Continual Harness adapts online within a single run. On Pokemon Red and Emerald across frontier models, Continual Harness starting from scratch substantially reduces button-press cost relative to the minimalist baseline and recovers a majority of the gap to a hand-engineered expert harness, with capability-dependent gains, despite starting from the same raw interface with no curated knowledge, no hand-crafted tools, and no domain scaffolding. We then close the loop with the model itself: an online process-reward co-learning loop, in which an open-source agent's rollouts through the refining harness are relabeled by a frontier teacher and used to update the model, drives sustained in-game milestone progress on Pokemon Red without resetting the environment between training iterations.