ChatPaper.aiChatPaper

TMAS : Mise à l’échelle du calcul en phase de test via la synergie multi-agent

TMAS: Scaling Test-Time Compute via Multi-Agent Synergy

May 11, 2026
Auteurs: George Wu, Nan Jing, Qing Yi, Chuan Hao, Ming Yang, Feng Chang, Yuan Wei, Jian Yang, Ran Tao, Bryan Dai
cs.AI

Résumé

Le passage à l'échelle au moment du test est devenu un paradigme efficace pour améliorer la capacité de raisonnement des grands modèles de langage en allouant des calculs supplémentaires lors de l'inférence. Des approches structurées récentes ont encore fait progresser ce paradigme en organisant l'inférence à travers de multiples trajectoires, itérations de raffinement et retours basés sur la vérification. Cependant, les méthodes structurées existantes de passage à l'échelle au moment du test soit coordonnent faiblement les trajectoires de raisonnement parallèles, soit s'appuient sur des informations historiques bruitées sans décider explicitement ce qui doit être conservé et réutilisé, limitant ainsi leur capacité à équilibrer exploration et exploitation. Dans ce travail, nous proposons TMAS, un cadre pour passer à l'échelle le calcul au moment du test via la synergie multi-agents. TMAS organise l'inférence comme un processus collaboratif entre agents spécialisés, permettant un flux d'informations structuré entre agents, trajectoires et itérations de raffinement. Pour soutenir une collaboration efficace entre trajectoires, TMAS introduit des mémoires hiérarchiques : la banque d'expérience réutilise les conclusions intermédiaires fiables de bas niveau et les retours locaux, tandis que la banque de directives enregistre les stratégies de haut niveau déjà explorées pour orienter les déploiements ultérieurs loin des schémas de raisonnement redondants. De plus, nous concevons un schéma d'apprentissage par renforcement à récompense hybride adapté à TMAS, qui préserve conjointement la capacité de raisonnement de base, améliore l'utilisation de l'expérience et encourage l'exploration au-delà des stratégies de solution déjà tentées. Des expériences approfondies sur des benchmarks de raisonnement difficiles démontrent que TMAS atteint un passage à l'échelle itératif plus fort que les bases de référence existantes en matière de passage à l'échelle au moment du test, tandis que l'entraînement par récompense hybride améliore encore l'efficacité et la stabilité du passage à l'échelle à travers les itérations. Le code et les données sont disponibles à l'adresse https://github.com/george-QF/TMAS-code.
English
Test-time scaling has become an effective paradigm for improving the reasoning ability of large language models by allocating additional computation during inference. Recent structured approaches have further advanced this paradigm by organizing inference across multiple trajectories, refinement rounds, and verification-based feedback. However, existing structured test-time scaling methods either weakly coordinate parallel reasoning trajectories or rely on noisy historical information without explicitly deciding what should be retained and reused, limiting their ability to balance exploration and exploitation. In this work, we propose TMAS, a framework for scaling test-time compute via multi-agent synergy. TMAS organizes inference as a collaborative process among specialized agents, enabling structured information flow across agents, trajectories, and refinement iterations. To support effective cross-trajectory collaboration, TMAS introduces hierarchical memories: the experience bank reuses low-level reliable intermediate conclusions and local feedback, while the guideline bank records previously explored high-level strategies to steer subsequent rollouts away from redundant reasoning patterns. Furthermore, we design a hybrid reward reinforcement learning scheme tailored to TMAS, which jointly preserves basic reasoning capability, enhances experience utilization, and encourages exploration beyond previously attempted solution strategies. Extensive experiments on challenging reasoning benchmarks demonstrate that TMAS achieves stronger iterative scaling than existing test-time scaling baselines, while hybrid reward training further improves scaling effectiveness and stability across iterations. Code and data are available at https://github.com/george-QF/TMAS-code.