ChatPaper.aiChatPaper

Pensar Enquanto Fala: Transferência de Conhecimento em Tempo de Inferência para Agentes de Voz Conversacionais Responsivos e Inteligentes

Thinking While Speaking: Inference-Time Knowledge Transfer for Responsive and Intelligent Conversational Voice Agents

June 23, 2026
Autores: Vidya Srinivas, Zachary Englhardt, Shwetak Patel, Vikram Iyer, Maximus Powers
cs.AI

Resumo

Os agentes de voz enfrentam uma tensão fundamental: o raciocínio, a recuperação e o uso de ferramentas que tornam os modelos fundacionais capazes são iterativos e lentos, enquanto a interação conversacional exige respostas em uma escala de milissegundos. Modelos menores e em tempo real atendem ao requisito de latência, mas não conseguem igualar os modelos fundacionais em tarefas complexas, deixando os agentes de voz atuais em um dilema entre capacidade de resposta e capacidade. Introduzimos o preenchimento conversacional (*conversational infill*), onde um pequeno modelo falante tanto gera imediatamente respostas contextualmente fundamentadas para ocultar a latência de um modelo raciocinador externo quanto integra fluentemente o conhecimento transmitido pelo raciocinador em suas respostas durante a inferência. Curadoria de um conjunto de dados sintético de 290.571 exemplos abrangendo seis domínios e demonstramos que essa tarefa é aprendível em sete modelos de linguagem pequenos amplamente utilizados, variando de 135M a 1,7B parâmetros. Nossa implementação do sistema, ConvFill, mantém um tempo de primeira resposta em nível de milissegundos enquanto reduz a diferença de precisão para dentro de 6,3% do desempenho do raciocinador de fronteira correspondente. Em um estudo de usuário ao vivo (n=18) com implantações do modelo falante executadas em um Apple M2 SoC, os participantes classificam o ConvFill como equivalente aos modelos de fronteira em geral, preferem-no para tarefas pesadas de recuperação e o avaliam como significativamente mais responsivo. Esses resultados mostram que o preenchimento conversacional desbloqueia um novo ponto na fronteira de Pareto latência-capacidade, oferecendo um caminho prático para agentes de voz que sejam tanto responsivos quanto altamente capazes. Código, modelos e conjuntos de dados estão disponíveis em https://github.com/vysri/conversational-infill.
English
Voice agents face a fundamental tension: the reasoning, retrieval, and tool use that make foundation models capable are iterative and slow, while conversational interaction demands responses on a millisecond timescale. Smaller, real-time models meet the latency bar but cannot match foundation models on complex tasks, leaving current voice agents to trade away either responsiveness or capability. We introduce conversational infill, where a small talker model both immediately generates contextually grounded responses to hide the latency of an external reasoner model and fluently integrates streamed reasoner knowledge into its responses during inference. We curate a 290,571-example synthetic dataset spanning six domains and demonstrate that this task is learnable across seven widely used small language models ranging from 135M to 1.7B parameters. Our system implementation, ConvFill, sustains millisecond-level time-to-first-response while closing the accuracy gap to within 6.3% of the corresponding frontier reasoner performance. In a live user study (n=18) with talker deployments running on an Apple M2 SoC, participants rank ConvFill on par with frontier models overall, prefer it for retrieval-heavy tasks, and rate it significantly more responsive. These results show that conversational infill unlocks a new point on the latency-capability Pareto frontier, offering a practical path toward voice agents that are both responsive and highly capable. Code, models, and datasets are available at https://github.com/vysri/conversational-infill.