PACEvolve++: Aprimorando a Aprendizagem em Tempo de Teste para Agentes de Busca Evolucionária
PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents
May 7, 2026
Autores: Minghao Yan, Bo Peng, Benjamin Coleman, Ziqi Chen, Zhouhang Xie, Shuo Chen, Zhankui He, Noveen Sachdeva, Weili Wang, Ed H. Chi, Shivaram Venkataraman, Wang-Cheng Kang, Derek Zhiyuan Cheng, Beidou Wang
cs.AI
Resumo
Grandes modelos de linguagem tornaram-se motores de busca evolutiva, mas a maioria dos sistemas depende de uma política fixa e elicitada por prompt para amostrar os próximos candidatos. Isso limita a adaptação em tarefas práticas de engenharia e pesquisa, onde as avaliações são caras e o progresso depende do aprendizado de dinâmicas específicas de busca. Apresentamos o PACEvolve++, uma estrutura de aprendizado por reforço baseada em modelo consultor para adaptação de política em tempo de teste em agentes de busca evolutiva. O PACEvolve++ separa decisões estratégicas de busca da implementação: um consultor treinável gera, avalia e seleciona hipóteses, enquanto um modelo de fronteira mais forte traduz as hipóteses selecionadas em candidatos executáveis. Para treinar o consultor sob feedback não estacionário, propomos uma abordagem adaptativa por fase, que ajusta sua estratégia de otimização a diferentes fases do processo evolutivo. No início da evolução, utiliza feedback relativo ao grupo para aprender preferências amplas de busca; posteriormente, à medida que as diferenças de recompensa se comprimem, enfatiza a contribuição de fronteira best-of-k para suportar refinamento estável. Em balanceamento de carga paralela especializada, recomendação sequencial e extrapolação de aptidão proteica, o PACEvolve++ supera a estrutura de busca evolutiva de última geração com modelos de fronteira, alcançando convergência mais rápida e estabilizando o treinamento em tempo de teste durante a busca evolutiva.
English
Large language models have become drivers of evolutionary search, but most systems rely on a fixed, prompt-elicited policy to sample next candidates. This limits adaptation in practical engineering and research tasks, where evaluations are expensive, and progress depends on learning task-specific search dynamics. We introduce PACEvolve++, an advisor-model reinforcement learning framework for test-time policy adaptation in evolutionary search agents. PACEvolve++ decouples strategic search decisions from implementation: a trainable advisor generates, assesses, and selects hypotheses, while a stronger frontier model translates selected hypotheses into executable candidates. To train the advisor under non-stationary feedback, we propose a phase-adaptive approach that adapts its optimization strategy to different phases of the evolutionary process. Early in evolution, it uses group-relative feedback to learn broad search preferences; later, as reward gaps compress, it emphasizes best-of-k frontier contribution to support stable refinement. Across expert-parallel load balancing, sequential recommendation, and protein fitness extrapolation, PACEvolve++ outperforms the state-of-the-art evolutionary search framework with frontier models, achieving faster convergence and stabilizing test-time training during evolutionary search.