Communication en continu dans le raisonnement multi-agent
Streaming Communication in Multi-Agent Reasoning
June 3, 2026
Auteurs: Zhen Yang, Xiaogang Xu, Wen Wang, Cong Chen, Xander Xu, Ying-Cong Chen
cs.AI
Résumé
Les systèmes de raisonnement multi-agents adoptent un paradigme « générer puis transférer » qui contraint la latence de bout en bout à évoluer linéairement avec la profondeur du pipeline. Nous présentons StreamMA, un système de raisonnement multi-agents qui diffuse chaque étape de raisonnement vers les agents en aval dès qu'elle est générée, mettant en pipeline les agents adjacents et réduisant ainsi la latence. De manière surprenante, cette mise en pipeline améliore également l'efficacité : parce que la qualité du raisonnement multi-étapes n'est pas uniforme et que les premières étapes sont plus fiables que les suivantes, travailler avec ces premières étapes fiables au lieu de la chaîne complète empêche les étapes tardives sujettes aux erreurs d'induire en erreur les agents en aval. Nous formalisons ces deux avantages grâce à la première analyse conjointe sous forme fermée des protocoles en continu, en série et simple, en déduisant l'ordre d'efficacité, la borne supérieure d'accélération et le rapport de coût. Sur huit benchmarks de raisonnement couvrant les mathématiques, les sciences et le code, deux LLM de pointe (Claude Opus 4.6 et GPT-5.4), et trois topologies (Chaîne, Arbre, Graphe), StreamMA surpasse les deux lignes de base (moy. +7,3 pp, max +22,4 pp sur HMMT 2026 ; Claude Opus 4.6-high). Au-delà de ces contributions, nous découvrons une « loi d'échelle au niveau des étapes » : augmenter le nombre d'étapes par agent améliore systématiquement à la fois l'efficacité et l'efficience, une nouvelle dimension d'échelle orthogonale et composable avec l'échelle du nombre d'agents.
English
Multi-agent reasoning systems adopt a "generate-then-transfer" paradigm that forces end-to-end latency to scale linearly with pipeline depth. We introduce StreamMA, a multi-agent reasoning system that streams each reasoning step to downstream agents as soon as it is generated, pipelining adjacent agents and thus reducing latency. Surprisingly, this pipelining also improves effectiveness: because multi-step reasoning quality is non-uniform and early steps are more reliable than later ones, working with these reliable early steps instead of the full chain prevents error-prone late steps from misleading downstream agents. We formalize both advantages with the first closed-form joint analysis of stream, serial, and single protocols, deriving the effectiveness ordering, speedup upper bound, and cost ratio. Across eight reasoning benchmarks spanning mathematics, science, and code, two frontier LLMs (Claude Opus 4.6 and GPT-5.4), and three topologies (Chain, Tree, Graph), StreamMA outperforms both baselines (avg. +7.3 pp, max +22.4 pp on HMMT 2026; Claude Opus 4.6-high). Beyond these contributions, we discover a "step-level scaling law": increasing per-agent steps consistently improves both effectiveness and efficiency, a new scaling dimension orthogonal to and composable with agent-count scaling.