Façonner le schéma via la représentation du langage comme prochaine frontière de l'expansion de l'intelligence des LLM
Shaping Schema via Language Representation as the Next Frontier for LLM Intelligence Expanding
May 10, 2026
Auteurs: Zhiqin Yang, Yuhan Liu, Jingwen Fu, Pei Fu anf Bo Han, Masashi Sugiyama, Nanning Zheng
cs.AI
Résumé
Bien que le langage naturel constitue le médium par défaut des modèles de langage de grande taille (LLMs), sa capacité expressive limitée crée un goulot d'étranglement profond pour la résolution de problèmes complexes. Alors que les avancées récentes en intelligence artificielle ont largement reposé sur le passage à l'échelle, la simple internalisation des connaissances ne garantit pas leur application efficace. Définissant la représentation langagière comme les constructions linguistiques et symboliques utilisées pour cartographier et modéliser le monde réel, cet article soutient que la formation de schémas par une représentation langagière avancée constitue la prochaine frontière pour étendre l'intelligence des LLMs. Nous postulons que l'activation et l'organisation des connaissances d'un LLM — son schéma — dépendent fortement de la sophistication structurelle et symbolique du langage utilisé pour représenter une tâche donnée. Cet article contribue à la fois une formalisation de cette affirmation et les preuves empiriques pour l'étayer. Avec une nouvelle formalisation, nous présentons plusieurs lignes de preuves à l'appui de notre position : premièrement, nous examinons des pratiques empiriques récentes et des méthodologies émergentes qui démontrent les gains de performance substantiels réalisables grâce à une conception délibérée de la représentation langagière, même sans modification des paramètres ou de l'échelle du modèle. Deuxièmement, nous menons des expériences contrôlées montrant que la performance d'un LLM et ses activations internes de caractéristiques varient selon différentes représentations langagières d'une même tâche sous-jacente. Ensemble, ces résultats soulignent que la conception de la représentation langagière constitue une direction prometteuse pour la recherche future.
English
Although natural language is the default medium for Large Language Models (LLMs), its limited expressive capacity creates a profound bottleneck for complex problem-solving. While recent advancements in AI have relied heavily on scaling, merely internalizing knowledge does not guarantee its effective application. Defining language representation as the linguistic and symbolic constructs used to map and model the real world, this paper argues that shaping schemas through advanced language representation is the next frontier for expanding LLM intelligence. We posit that an LLM's knowledge activation and organization -- its schema -- depends heavily on the structural and symbolic sophistication of the language used to represent a given task. This paper contributes both a formalization of this claim and the empirical evidence to support it. With a new formalization, we present multiple lines of evidence to support our position: Firstly, we review recent empirical practices and emerging methodologies that demonstrate the substantial performance gains achievable through deliberate language representation design, even without modifying model parameters or scale. Secondly, we conduct controlled experiments showing that LLM performance and its internal feature activations vary under different language representations of the same underlying task. Together, these findings highlight language representation design as a promising direction for future research.