Denken tijdens het spreken: Kennisoverdracht tijdens de inferentie voor responsieve en intelligente conversationele stemagenten
Thinking While Speaking: Inference-Time Knowledge Transfer for Responsive and Intelligent Conversational Voice Agents
June 23, 2026
Auteurs: Vidya Srinivas, Zachary Englhardt, Shwetak Patel, Vikram Iyer, Maximus Powers
cs.AI
Samenvatting
Stemagenten worden geconfronteerd met een fundamentele spanning: de redenering, het ophalen van informatie en het gebruik van hulpmiddelen die fundatiemodellen bekwaam maken, zijn iteratief en traag, terwijl conversationele interactie reacties binnen milliseconden vereist. Kleinere real-time modellen voldoen aan de latentiedrempel, maar kunnen qua complexe taken niet tippen aan fundatiemodellen, waardoor huidige stemagenten moeten inleveren op ofwel responsiviteit ofwel capaciteit. Wij introduceren conversationele aanvulling, waarbij een klein spraakmodel zowel direct contextueel onderbouwde reacties genereert om de latentie van een extern redeneermodel te verbergen, alsook tijdens de inferentie vloeiend de gestreamde kennis van het redeneermodel in zijn reacties integreert. We stellen een synthetische dataset samen met 290.571 voorbeelden uit zes domeinen en tonen aan dat deze taak leerbaar is voor zeven veelgebruikte kleine taalmodellen variërend van 135M tot 1,7B parameters. Onze systeemimplementatie, ConvFill, handhaaft een tijd-tot-eerste-reactie op millisecondenniveau, terwijl de nauwkeurigheidskloof wordt verkleind tot binnen 6,3% van de corresponderende prestaties van het grensverleggende redeneermodel. In een live gebruikersonderzoek (n=18) met spraakmodellen die draaien op een Apple M2 SoC, beoordelen deelnemers ConvFill over het algemeen als gelijkwaardig aan grensverleggende modellen, geven ze er de voorkeur aan bij taken die veel ophaalwerk vereisen, en vinden ze het significant responsiever. Deze resultaten tonen aan dat conversationele aanvulling een nieuw punt op de latentie-capaciteit Pareto-grens ontsluit, wat een praktische weg biedt naar stemagenten die zowel responsief als zeer bekwaam zijn. Code, modellen en datasets zijn beschikbaar op https://github.com/vysri/conversational-infill.
English
Voice agents face a fundamental tension: the reasoning, retrieval, and tool use that make foundation models capable are iterative and slow, while conversational interaction demands responses on a millisecond timescale. Smaller, real-time models meet the latency bar but cannot match foundation models on complex tasks, leaving current voice agents to trade away either responsiveness or capability. We introduce conversational infill, where a small talker model both immediately generates contextually grounded responses to hide the latency of an external reasoner model and fluently integrates streamed reasoner knowledge into its responses during inference. We curate a 290,571-example synthetic dataset spanning six domains and demonstrate that this task is learnable across seven widely used small language models ranging from 135M to 1.7B parameters. Our system implementation, ConvFill, sustains millisecond-level time-to-first-response while closing the accuracy gap to within 6.3% of the corresponding frontier reasoner performance. In a live user study (n=18) with talker deployments running on an Apple M2 SoC, participants rank ConvFill on par with frontier models overall, prefer it for retrieval-heavy tasks, and rate it significantly more responsive. These results show that conversational infill unlocks a new point on the latency-capability Pareto frontier, offering a practical path toward voice agents that are both responsive and highly capable. Code, models, and datasets are available at https://github.com/vysri/conversational-infill.