TMAS: Opschaling van testtijdcomputatie via multi-agent synergie
TMAS: Scaling Test-Time Compute via Multi-Agent Synergy
May 11, 2026
Auteurs: George Wu, Nan Jing, Qing Yi, Chuan Hao, Ming Yang, Feng Chang, Yuan Wei, Jian Yang, Ran Tao, Bryan Dai
cs.AI
Samenvatting
Testtijd-schaling is een effectief paradigma geworden voor het verbeteren van het redeneervermogen van grote taalmodellen door tijdens inferentie extra rekenkracht toe te wijzen. Recente gestructureerde benaderingen hebben dit paradigma verder uitgebreid door inferentie te organiseren over meerdere trajecten, verfijningsrondes en verificatie-gebaseerde feedback. Bestaande gestructureerde testtijd-schalingsmethoden coördineren parallelle redeneertrajecten echter slechts zwak of vertrouwen op ruizige historische informatie zonder expliciet te beslissen wat moet worden behouden en hergebruikt, wat hun vermogen om exploratie en exploitatie in evenwicht te brengen beperkt. In dit werk stellen we TMAS voor, een raamwerk voor het schalen van testtijd-rekenkracht via multi-agent synergie. TMAS organiseert inferentie als een collaboratief proces tussen gespecialiseerde agenten, waardoor gestructureerde informatiestroom mogelijk wordt tussen agenten, trajecten en verfijningsiteraties. Om effectieve samenwerking over trajecten heen te ondersteunen, introduceert TMAS hiërarchische geheugens: de ervaringsbank hergebruikt laag-niveau betrouwbare tussentijdse conclusies en lokale feedback, terwijl de richtlijnenbank eerder verkende hoog-niveau strategieën opslaat om volgende rollouts weg te sturen van redundante redeneerpatronen. Verder ontwerpen we een hybride belonings-reinforcement learning schema dat is toegesneden op TMAS, dat gezamenlijk basisredeneercapaciteit behoudt, ervaringsgebruik verbetert en exploratie buiten eerder geprobeerde oplossingsstrategieën stimuleert. Uitgebreide experimenten op uitdagende redeneerbenchmarks tonen aan dat TMAS sterkere iteratieve schaling bereikt dan bestaande testtijd-schalingsbaselines, terwijl hybride beloningstraining de schalingseffectiviteit en stabiliteit over iteraties verder verbetert. Code en data zijn beschikbaar op https://github.com/george-QF/TMAS-code.
English
Test-time scaling has become an effective paradigm for improving the reasoning ability of large language models by allocating additional computation during inference. Recent structured approaches have further advanced this paradigm by organizing inference across multiple trajectories, refinement rounds, and verification-based feedback. However, existing structured test-time scaling methods either weakly coordinate parallel reasoning trajectories or rely on noisy historical information without explicitly deciding what should be retained and reused, limiting their ability to balance exploration and exploitation. In this work, we propose TMAS, a framework for scaling test-time compute via multi-agent synergy. TMAS organizes inference as a collaborative process among specialized agents, enabling structured information flow across agents, trajectories, and refinement iterations. To support effective cross-trajectory collaboration, TMAS introduces hierarchical memories: the experience bank reuses low-level reliable intermediate conclusions and local feedback, while the guideline bank records previously explored high-level strategies to steer subsequent rollouts away from redundant reasoning patterns. Furthermore, we design a hybrid reward reinforcement learning scheme tailored to TMAS, which jointly preserves basic reasoning capability, enhances experience utilization, and encourages exploration beyond previously attempted solution strategies. Extensive experiments on challenging reasoning benchmarks demonstrate that TMAS achieves stronger iterative scaling than existing test-time scaling baselines, while hybrid reward training further improves scaling effectiveness and stability across iterations. Code and data are available at https://github.com/george-QF/TMAS-code.