ChatPaper.aiChatPaper

Conectando os Pontos: Treinando LLMs para Agentes de Ciclo de Vida Longo com Generalização entre Domínios via Aprendizado por Reforço

Connect the Dots: Training LLMs for Long-Lifecycle Agents with Cross-Domain Generalization Via Reinforcement Learning

June 18, 2026
Autores: Yanxi Chen, Weijie Shi, Yuexiang Xie, Boyi Hu, Yaliang Li, Bolin Ding, Jingren Zhou
cs.AI

Resumo

Este trabalho apresenta uma estrutura geral para treinar grandes modelos de linguagem (LLMs) a "Conectar os Pontos" (CoD), uma meta-capacidade necessária para agentes de longo ciclo de vida: à medida que um agente de IA baseado em LLM é implantado em um ambiente, ele resolve uma longa sequência de tarefas enquanto explora continuamente o ambiente, aprende com suas próprias experiências e atualiza iterativamente seu contexto sobre o ambiente, alcançando assim um desempenho progressivamente melhor em tarefas futuras condicionadas ao contexto atualizado. Os principais componentes da estrutura CoD incluem: (1) projeto de algoritmos e infraestrutura para aprendizagem por reforço (RL) de ponta a ponta com longas sequências de rollout que intercalam episódios de resolução de tarefas e atualização de contexto; (2) tarefas e ambientes para incentivar e eliciar a meta-capacidade alvo nos LLMs durante o treinamento, bem como para medir fielmente o progresso durante a avaliação. Apresentamos implementações de prova de conceito da estrutura CoD, incluindo um algoritmo RL no estilo GRPO com atribuição de crédito granular, além de tarefas e ambientes adaptados à meta-capacidade alvo (em vez de capacidades LLM específicas de domínio ou RL padrão tarefa por tarefa). Resultados empíricos validam a eficácia do treinamento RL de ponta a ponta no contexto CoD e demonstram o potencial de generalização fora da distribuição — dentro dos domínios de treinamento, entre diferentes domínios, e de CoD para configurações de loop Ralph — da meta-capacidade elicitada. Nossa investigação sobre CoD conecta várias linhas de trabalhos anteriores e abre novas oportunidades para avançar LLMs e agentes de IA. Para facilitar futuras pesquisas e aplicações, disponibilizamos nossas implementações em https://github.com/agentscope-ai/Trinity-RFT/tree/research/cod/examples/research_cod.
English
This work presents a general framework for training large language models (LLMs) to "Connect the Dots" (CoD), a meta-capability required by long-lifecycle agents: as an LLM-based AI agent gets deployed in an environment, it solves a long sequence of tasks while continuously exploring the environment, learning from its own experiences, and iteratively self-updating its context about the environment, thereby achieving progressively better performance on future tasks conditioned on the updated context. Major components of the CoD framework include: (1) algorithm design and infrastructure for end-to-end reinforcement learning (RL) with long rollout sequences interleaving solve-task and update-context episodes; (2) tasks and environments for incentivizing and eliciting the targeted meta-capability in LLMs during training, as well as for faithfully measuring progress during evaluation. We present proof-of-concept implementations of the CoD framework, including a GRPO-style RL algorithm with fine-grained credit assignment, as well as tasks and environments tailored to the targeted meta-capability (rather than domain-specific LLM capabilities or standard task-by-task RL). Empirical results validate the efficacy of end-to-end RL training in the CoD setting, and demonstrate the potential for out-of-distribution generalization -- within the training domains, across different domains, and from CoD to Ralph-loop settings -- of the elicited meta-capability. Our investigation of CoD connects several lines of prior works, and opens up new opportunities for advancing LLMs and AI agents. To facilitate further research and applications, we release our implementations at https://github.com/agentscope-ai/Trinity-RFT/tree/research/cod/examples/research_cod.