De Aprendiz a Treinador: Ambiente de Treinamento Projetado por LLM para Aprendizado por Reforço com Raciocínio Multiagente
From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning
June 16, 2026
Autores: Chao Chen, Chengzu Li, Zhiwei Li, Yinhong Liu, Zhijiang Guo
cs.AI
Resumo
Pipelines de aprendizado por reforço para treinamento de Modelos de Linguagem de Grande Porte (LLMs) frequentemente dependem de ambientes manualmente redesenhados entre estágios, exigindo que profissionais infiram heuristicamente qual configuração melhorará a política atual. Para automatizar esse processo, propomos o framework LLM-como-Engenheiro-de-Ambiente, no qual o modelo de política atual analisa trajetórias de falhas juntamente com informações contextuais e propõe modificações na configuração do ambiente de treinamento do próximo estágio. Também introduzimos MAPF-FrozenLake, uma bancada de testes controlável cujo gerador expõe configurações ambientais multidimensionais, tornando-a adequada para estudar e avaliar o redesenho de ambientes. Nessa bancada de testes, condicionamos o engenheiro de ambiente a resumos estruturados do comportamento da política, casos de falha e estatísticas do ambiente, a partir dos quais ele produz a configuração para o próximo estágio de treinamento. Com Qwen3-4B como espinha dorsal, nosso framework alcança o desempenho agregado mais forte em nossos benchmarks, superando LLMs proprietários maiores (por exemplo, GPT, Gemini) e linhas de base de treinamento com ambiente fixo. Analisamos ainda quais formas de contexto são mais eficazes, descobrindo que atualizações bem-sucedidas do ambiente dependem de evidências de falha e preservam configurações que já funcionam. Curiosamente, o checkpoint atual de RL serve como um engenheiro de ambiente melhor do que o modelo base original, sugerindo que o aprendizado da política melhora a capacidade do modelo de diagnosticar suas fraquezas remanescentes.
English
Reinforcement learning pipelines for Large Language Model (LLM) training often rely on manually redesigned environments between stages, requiring practitioners to heuristically infer which configuration will best improve the current policy. To automate this process, we propose the LLM-as-Environment-Engineer framework in which the current policy model analyzes failure trajectories together with contextual information and proposes modifications to the next-stage training environment configuration. We also introduce MAPF-FrozenLake, a controllable testbed whose generator exposes multi-dimensional environment configurations, making it suitable for studying and benchmarking environment redesign. On this testbed, we condition the environment engineer on structured summaries of policy behavior, failure cases, and environment statistics, from which it produces the configuration for the next training stage. With Qwen3-4B as the backbone, our framework achieves the strongest aggregate performance on our benchmarks, outperforming larger proprietary LLMs (e.g., GPT, Gemini) and fixed-environment training baselines. We further analyze which forms of context are most effective, finding that successful environment updates rely on failure evidence and preserve configurations that already work. Interestingly, the current RL checkpoint serves as a better environment engineer than the original base model, suggesting that policy learning improves the model's ability to diagnose its remaining weaknesses.