ChatPaper.aiChatPaper

AgentOdyssey: Geração de Jogos de Texto de Horizonte Longo e Aberto para Agentes de Aprendizado Contínuo em Tempo de Teste

AgentOdyssey: Open-Ended Long-Horizon Text Game Generation for Test-Time Continual Learning Agents

May 29, 2026
Autores: Zheyuan Zhang, Zehao Wen, Alvin Zhang, Andrew Wang, Jianwen Xie, Daniel Khashabi, Tianmin Shu
cs.AI

Resumo

Para que agentes aprendam continuamente a partir da interação com o mundo durante o teste, eles devem ser capazes de explorar eficazmente, adquirir novos conhecimentos e habilidades sobre o mundo, reter experiências episódicas relevantes e planejar em horizontes longos. Para avaliar essas habilidades-chave de agentes de aprendizado contínuo em tempo de teste, apresentamos o AgentOdyssey, uma nova estrutura de avaliação que gera proceduralmente jogos de texto abertos com entidades ricas, dinâmicas de mundo e tarefas de horizonte longo. Criticamente, o AgentOdyssey vai além da suposição convencional de aprendizado de máquina de que não há aprendizado durante o teste, colocando os agentes em um cenário contínuo e de longo horizonte que intercala aprendizado e inferência ao longo da implantação. Propomos ainda uma metodologia de avaliação multifacetada que mede não apenas o progresso no jogo, mas também oferece testes diagnósticos sobre aquisição de conhecimento do mundo, memória episódica, exploração de objetos e ações, diversidade de ações e custo do modelo. Avaliamos diversos paradigmas de agentes nos jogos gerados. Nossos resultados experimentais revelam limites críticos nas habilidades-chave dos agentes, bem como fatores que influenciam seu horizonte significativo. Embora o desempenho escale com modelos base mais fortes, mesmo o melhor agente permanece muito abaixo do desempenho humano, deixando margem substancial para melhoria. Entre os mecanismos dos agentes, descobrimos que a memória de curto prazo beneficia múltiplos paradigmas de agentes e é um componente importante do treinamento do agente em tempo de teste.
English
For agents to learn continuously from interaction with the world at test time, they must be able to explore effectively, acquire new world knowledge and skills, retain relevant episodic experiences, and plan over long horizons. To evaluate these key abilities of test-time continual learning agents, we introduce AgentOdyssey, a novel evaluation framework that procedurally generates open-ended text games with rich entities, world dynamics, and long-horizon tasks. Critically, AgentOdyssey goes beyond the conventional machine learning assumption that learning does not occur at test time by placing agents in a continuous, long-horizon setting that interleaves learning and inference throughout deployment. We further propose a multifaceted evaluation methodology that measures not only game progress but also offers diagnostic tests on world knowledge acquisition, episodic memory, object and action exploration, action diversity, and model cost. We evaluate diverse agent paradigms in the generated games. Our experimental results reveal critical limits in agents' key abilities, as well as factors that influence their meaningful horizon. Although performance scales with stronger base models, even the top agent remains far below human performance, leaving substantial headroom for improvement. Among agent mechanisms, we find that short-term memory benefits multiple agent paradigms and is an important component of agent test-time training.