TMAS: Escalonamento da Computação em Tempo de Teste via Sinergia Multiagente
TMAS: Scaling Test-Time Compute via Multi-Agent Synergy
May 11, 2026
Autores: George Wu, Nan Jing, Qing Yi, Chuan Hao, Ming Yang, Feng Chang, Yuan Wei, Jian Yang, Ran Tao, Bryan Dai
cs.AI
Resumo
A ampliação em tempo de teste tornou-se um paradigma eficaz para melhorar a capacidade de raciocínio de grandes modelos de linguagem ao alocar computação adicional durante a inferência. Abordagens estruturadas recentes avançaram ainda mais esse paradigma ao organizar a inferência em múltiplas trajetórias, rodadas de refinamento e feedback baseado em verificação. No entanto, os métodos estruturados existentes de ampliação em tempo de teste ou coordenam fracamente trajetórias de raciocínio paralelas, ou dependem de informações históricas ruidosas sem decidir explicitamente o que deve ser retido e reutilizado, limitando sua capacidade de equilibrar exploração e aproveitamento. Neste trabalho, propomos TMAS, uma estrutura para ampliar a computação em tempo de teste por meio de sinergia multiagente. O TMAS organiza a inferência como um processo colaborativo entre agentes especializados, permitindo um fluxo estruturado de informações entre agentes, trajetórias e iterações de refinamento. Para apoiar a colaboração eficaz entre trajetórias, o TMAS introduz memórias hierárquicas: o banco de experiências reutiliza conclusões intermediárias confiáveis de baixo nível e feedback local, enquanto o banco de diretrizes registra estratégias de alto nível previamente exploradas para orientar lançamentos subsequentes, evitando padrões de raciocínio redundantes. Além disso, projetamos um esquema de aprendizado por reforço com recompensa híbrida adaptado ao TMAS, que preserva conjuntamente a capacidade básica de raciocínio, melhora a utilização de experiências e incentiva a exploração além das estratégias de solução previamente tentadas. Experimentos extensivos em benchmarks desafiadores de raciocínio demonstram que o TMAS alcança uma ampliação iterativa mais forte do que as linhas de base existentes de ampliação em tempo de teste, enquanto o treinamento com recompensa híbrida melhora ainda mais a eficácia e a estabilidade da ampliação ao longo das iterações. O código e os dados estão disponíveis em https://github.com/george-QF/TMAS-code.
English
Test-time scaling has become an effective paradigm for improving the reasoning ability of large language models by allocating additional computation during inference. Recent structured approaches have further advanced this paradigm by organizing inference across multiple trajectories, refinement rounds, and verification-based feedback. However, existing structured test-time scaling methods either weakly coordinate parallel reasoning trajectories or rely on noisy historical information without explicitly deciding what should be retained and reused, limiting their ability to balance exploration and exploitation. In this work, we propose TMAS, a framework for scaling test-time compute via multi-agent synergy. TMAS organizes inference as a collaborative process among specialized agents, enabling structured information flow across agents, trajectories, and refinement iterations. To support effective cross-trajectory collaboration, TMAS introduces hierarchical memories: the experience bank reuses low-level reliable intermediate conclusions and local feedback, while the guideline bank records previously explored high-level strategies to steer subsequent rollouts away from redundant reasoning patterns. Furthermore, we design a hybrid reward reinforcement learning scheme tailored to TMAS, which jointly preserves basic reasoning capability, enhances experience utilization, and encourages exploration beyond previously attempted solution strategies. Extensive experiments on challenging reasoning benchmarks demonstrate that TMAS achieves stronger iterative scaling than existing test-time scaling baselines, while hybrid reward training further improves scaling effectiveness and stability across iterations. Code and data are available at https://github.com/george-QF/TMAS-code.