Grandes Modelos de Linguagem em Redes: Inteligência Colaborativa sob Restrições de Recursos
Large Language Models over Networks: Collaborative Intelligence under Resource Constraints
May 9, 2026
Autores: Liangqi Yuan, Wenzhi Fang, Shiqiang Wang, H. Vincent Poor, Christopher G. Brinton
cs.AI
Resumo
Os modelos de linguagem de grande escala (LLMs) estão transformando a sociedade, impulsionando aplicações que vão de assistentes em smartphones à direção autônoma. No entanto, os serviços baseados em LLMs em nuvem, por si só, não conseguem atender a uma classe crescente de aplicações, incluindo aquelas que operam sob conectividade intermitente, orçamentos de latência de submilissegundo, restrições de residência de dados ou inferência de alto volume sustentada. A implantação em dispositivos, por sua vez, é limitada por restrições de computação e memória. Nenhum ponto único de serviço consegue oferecer qualidade superior ao longo desse espectro. Este artigo foca na inteligência colaborativa, um paradigma no qual múltiplos LLMs independentes, distribuídos entre dispositivos e endpoints na nuvem, colaboram no nível de tarefas por meio de linguagem natural ou mensagens estruturadas. Essa colaboração busca qualidade superior de resposta sob restrições heterogêneas de recursos, abrangendo computação, memória, comunicação e custo entre camadas de rede. Apresentamos a inferência colaborativa ao longo de duas dimensões complementares e combináveis: colaboração vertical dispositivo-nuvem e colaboração horizontal multiagente, que podem ser combinadas em topologias híbridas na prática. Em seguida, examinamos o aprendizado para colaborar, abordando o treinamento de políticas de roteamento e o desenvolvimento de capacidades cooperativas entre LLMs. Por fim, identificamos desafios de pesquisa em aberto, incluindo escalabilidade sob heterogeneidade de recursos e inteligência colaborativa confiável.
English
Large language models (LLMs) are transforming society, powering applications from smartphone assistants to autonomous driving. Yet cloud-based LLM services alone cannot serve a growing class of applications, including those operating under intermittent connectivity, sub-second latency budgets, data-residency constraints, or sustained high-volume inference. On-device deployment is in turn constrained by limited computation and memory. No single endpoint can deliver high-quality service across this spectrum. This article focuses on collaborative intelligence, a paradigm in which multiple independent LLMs distributed across device and cloud endpoints collaborate at the task level through natural language or structured messages. Such collaboration strives for superior response quality under heterogeneous resource constraints spanning computation, memory, communication, and cost across network tiers. We present collaborative inference along two complementary and composable dimensions: vertical device-cloud collaboration and horizontal multi-agent collaboration, which can be combined into hybrid topologies in practice. We then examine learning to collaborate, addressing the training of routing policies and the development of cooperative capabilities among LLMs. Finally, we identify open research challenges including scaling under resource heterogeneity and trustworthy collaborative intelligence.