NeuroCogMap révèle l'organisation cognitive des grands modèles de langage
NeuroCogMap Reveals Cognitive Organization of Large Language Models
July 1, 2026
Auteurs: Zhongxiang Sun, Haolang Lu, Qiang Ma, Qi Li, Qipeng Wang, Liang Pang, Chenyu Liu, Qiankun Li, Hao Sun, Kun Wang, Yi Zeng, Jun Xu, Guoqi Li, Ji-Rong Wen
cs.AI
Résumé
Comprendre comment les fonctions cognitives complexes sont organisées au sein des systèmes artificiels est essentiel pour interpréter les grands modèles de langage (LLMs) et les relier à la cognition biologique. Pourtant, bien que les LLMs présentent des comportements largement analogues à la cognition, il reste incertain si leurs représentations internes forment des systèmes fonctionnels reproductibles qui expliquent le comportement, les défaillances et les liens avec la cognition humaine. Nous présentons ici NeuroCogMap, un cadre inspiré des neurosciences cognitives qui organise les caractéristiques internes des LLMs en parcelles fonctionnelles et les relie à des fonctions interprétables, des capacités cognitives et une hiérarchie cognitive. Ces parcelles forment une organisation stable et sémantiquement cohérente, partiellement conservée d'un modèle à l'autre, et fonctionnellement liée aux sorties du modèle. Au sein de cette organisation, les principales défaillances des LLMs, notamment l'hallucination, le biais, l'échec de refus et la sycophanterie, correspondent à des perturbations distinctes des systèmes de représentation et de contrôle comportemental, fournissant des signatures internes pour une détection guidée par les mécanismes et une intervention ciblée. Au-delà du comportement des modèles, NeuroCogMap améliore la prédiction des réponses corticales humaines lors de la compréhension naturaliste du langage, avec la correspondance la plus forte dans le cortex d'association supérieur. Au niveau cognitif, ses signatures internes révèlent des stratégies latentes qui guident les affinements des modèles classiques de prise de décision humaine. Ensemble, ces résultats établissent NeuroCogMap comme un cadre au niveau système pour cartographier l'organisation fonctionnelle dans les systèmes artificiels et pour relier cette organisation à la fonction corticale humaine et au comportement cognitif.
English
Understanding how complex cognitive functions are organized within artificial systems is central to interpreting large language models (LLMs) and relating them to biological cognition. Yet although LLMs exhibit broad cognitive-like behaviours, it remains unclear whether their internal representations form reproducible functional systems that explain behaviour, failure and links to human cognition. Here we present NeuroCogMap, a cognitive neuroscience-inspired framework that organizes internal features of LLMs into functional parcels and links them to interpretable functions, cognitive capabilities and a cognitive hierarchy. These parcels form a stable and semantically coherent organization that is partly conserved across models and functionally linked to model outputs. Within this organization, major LLM failures, including hallucination, bias, refusal failure and sycophancy, correspond to distinct disruptions in representational and behavioural-control systems, yielding internal signatures for mechanism-guided detection and targeted intervention. Beyond model behaviour, NeuroCogMap improves prediction of human cortical responses during naturalistic language comprehension, with the strongest correspondence in higher-order association cortex. At the cognitive level, its internal signatures expose latent strategies that guide refinements of classical models of human decision-making. Together, these findings establish NeuroCogMap as a system-level framework for mapping functional organization in artificial systems and for relating this organization to human cortical function and cognitive behaviour.