Modelagem de Esquemas via Representação da Linguagem como a Próxima Fronteira para a Expansão da Inteligência de LLMs
Shaping Schema via Language Representation as the Next Frontier for LLM Intelligence Expanding
May 10, 2026
Autores: Zhiqin Yang, Yuhan Liu, Jingwen Fu, Pei Fu anf Bo Han, Masashi Sugiyama, Nanning Zheng
cs.AI
Resumo
Embora a linguagem natural seja o meio padrão para Modelos de Linguagem de Grande Escala (LLMs), sua capacidade expressiva limitada cria um gargalo profundo para a resolução de problemas complexos. Embora os avanços recentes em IA tenham dependido fortemente do escalonamento, a mera internalização do conhecimento não garante sua aplicação eficaz. Definindo representação linguística como os construtos linguísticos e simbólicos usados para mapear e modelar o mundo real, este artigo argumenta que moldar esquemas por meio da representação linguística avançada é a próxima fronteira para expandir a inteligência dos LLMs. Postulamos que a ativação e organização do conhecimento de um LLM — seu esquema — depende fortemente da sofisticação estrutural e simbólica da linguagem usada para representar uma dada tarefa. Este artigo contribui tanto com uma formalização dessa afirmação quanto com evidências empíricas que a sustentam. Com uma nova formalização, apresentamos múltiplas linhas de evidência para apoiar nossa posição: Primeiro, revisamos práticas empíricas recentes e metodologias emergentes que demonstram os ganhos substanciais de desempenho alcançáveis por meio do design deliberado da representação linguística, mesmo sem modificar parâmetros ou escala do modelo. Segundo, realizamos experimentos controlados mostrando que o desempenho dos LLMs e suas ativações internas de características variam sob diferentes representações linguísticas da mesma tarefa subjacente. Em conjunto, esses achados destacam o design da representação linguística como uma direção promissora para pesquisas futuras.
English
Although natural language is the default medium for Large Language Models (LLMs), its limited expressive capacity creates a profound bottleneck for complex problem-solving. While recent advancements in AI have relied heavily on scaling, merely internalizing knowledge does not guarantee its effective application. Defining language representation as the linguistic and symbolic constructs used to map and model the real world, this paper argues that shaping schemas through advanced language representation is the next frontier for expanding LLM intelligence. We posit that an LLM's knowledge activation and organization -- its schema -- depends heavily on the structural and symbolic sophistication of the language used to represent a given task. This paper contributes both a formalization of this claim and the empirical evidence to support it. With a new formalization, we present multiple lines of evidence to support our position: Firstly, we review recent empirical practices and emerging methodologies that demonstrate the substantial performance gains achievable through deliberate language representation design, even without modifying model parameters or scale. Secondly, we conduct controlled experiments showing that LLM performance and its internal feature activations vary under different language representations of the same underlying task. Together, these findings highlight language representation design as a promising direction for future research.