ChatPaper.aiChatPaper

Multi-Stream LLM's: Het Ontgrendelen van Taalmodellen met Parallelle Stromen van Gedachten, Invoer en Uitvoer

Multi-Stream LLMs: Unblocking Language Models with Parallel Streams of Thoughts, Inputs and Outputs

May 12, 2026
Auteurs: Guinan Su, Yanwu Yang, Xueyan Li, Jonas Geiping
cs.AI

Samenvatting

De voortdurende verbeteringen in de capaciteit van taalmodellen hebben hun wijdverbreide gebruik als aanstuurders van autonome agenten mogelijk gemaakt, bijvoorbeeld bij codeer- of computergebruikstoepassingen. De kern van deze systemen is echter niet veel veranderd sinds de vroege instructiegetunede modellen zoals ChatGPT. Zelfs geavanceerde AI-agenten werken op basis van berichtenuitwisselingsformaten, waarbij achtereenvolgens berichten worden uitgewisseld met gebruikers, systemen, met zichzelf (d.w.z. gedachteketens) en hulpmiddelen in één enkele rekenstroom. Dit knelpunt tot een enkele stroom in chatmodellen leidt tot een aantal beperkingen: de agent kan niet handelen (output genereren) tijdens het lezen, en omgekeerd niet reageren op nieuwe informatie tijdens het schrijven. Evenzo kan de agent niet handelen tijdens het denken en niet denken tijdens het lezen of handelen op basis van informatie. In dit werk tonen we aan dat modellen kunnen worden ontstopt door over te schakelen van instructie-tuning voor sequentiële berichtformaten naar instructie-tuning voor meerdere, parallelle rekenstromen, waarbij elke rol wordt gesplitst in een aparte stroom. Elke voorwaartse doorgang van het taalmodel leest dan gelijktijdig van meerdere invoerstromen en genereert tokens in meerdere uitvoerstromen, die allemaal causaal afhankelijk zijn van eerdere tijdstappen. Wij stellen dat deze datagedreven verandering een aantal van de hierboven geschetste bruikbaarheidsbeperkingen verhelpt, de model efficiëntie verbetert door parallelisatie, de modelbeveiliging verbetert door een betere scheiding van verantwoordelijkheden en de monitorbaarheid van het model verder kan verbeteren.
English
The continued improvements in language model capability have unlocked their widespread use as drivers of autonomous agents, for example in coding or computer use applications. However, the core of these systems has not changed much since early instruction-tuned models like ChatGPT. Even advanced AI agents function on message exchange formats, successively exchanging messages with users, systems, with itself (i.e. chain-of-thought) and tools in a single stream of computation. This bottleneck to a single stream in chat models leads to a number of limitations: the agent cannot act (generate output) while reading, and in reverse, cannot react to new information while writing. Similarly, the agent cannot act while thinking and cannot think while reading or acting on information. In this work, we show that models can be unblocked by switching from instruction-tuning for sequential message formats to instruction-tuning for multiple, parallel streams of computation, splitting each role into a separate stream. Every forward pass of the language model then simultaneously reads from multiple input streams and generates tokens in multiple output streams, all of which causally depend on earlier timesteps. We argue that this data-driven change remedies a number of usability limitations as outlined above, improves model efficiency through parallelization, improves model security through better separation of concerns and can further improve model monitorability.