NeuroCogMap Revela a Organização Cognitiva de Modelos de Linguagem de Grande Escala
NeuroCogMap Reveals Cognitive Organization of Large Language Models
July 1, 2026
Autores: Zhongxiang Sun, Haolang Lu, Qiang Ma, Qi Li, Qipeng Wang, Liang Pang, Chenyu Liu, Qiankun Li, Hao Sun, Kun Wang, Yi Zeng, Jun Xu, Guoqi Li, Ji-Rong Wen
cs.AI
Resumo
Compreender como funções cognitivas complexas são organizadas em sistemas artificiais é central para interpretar modelos de linguagem de grande escala (LLMs) e relacioná-los à cognição biológica. No entanto, embora os LLMs exibam comportamentos amplamente cognitivos, ainda não está claro se suas representações internas formam sistemas funcionais reproduzíveis que expliquem comportamento, falhas e vínculos com a cognição humana. Neste artigo, apresentamos o NeuroCogMap, uma estrutura inspirada na neurociência cognitiva que organiza características internas de LLMs em parcelas funcionais e as vincula a funções interpretáveis, capacidades cognitivas e uma hierarquia cognitiva. Essas parcelas formam uma organização estável e semanticamente coerente, que é parcialmente conservada entre modelos e funcionalmente ligada às saídas do modelo. Dentro dessa organização, falhas importantes dos LLMs, incluindo alucinação, viés, falha de recusa e sicofancia, correspondem a perturbações distintas nos sistemas de representação e controle comportamental, gerando assinaturas internas para detecção guiada por mecanismos e intervenção direcionada. Além do comportamento do modelo, o NeuroCogMap melhora a previsão de respostas corticais humanas durante a compreensão naturalística da linguagem, com a correspondência mais forte no córtex de associação de ordem superior. No nível cognitivo, suas assinaturas internas expõem estratégias latentes que orientam refinamentos de modelos clássicos de tomada de decisão humana. Em conjunto, esses achados estabelecem o NeuroCogMap como uma estrutura em nível de sistema para mapear a organização funcional em sistemas artificiais e para relacionar essa organização à função cortical e ao comportamento cognitivo humano.
English
Understanding how complex cognitive functions are organized within artificial systems is central to interpreting large language models (LLMs) and relating them to biological cognition. Yet although LLMs exhibit broad cognitive-like behaviours, it remains unclear whether their internal representations form reproducible functional systems that explain behaviour, failure and links to human cognition. Here we present NeuroCogMap, a cognitive neuroscience-inspired framework that organizes internal features of LLMs into functional parcels and links them to interpretable functions, cognitive capabilities and a cognitive hierarchy. These parcels form a stable and semantically coherent organization that is partly conserved across models and functionally linked to model outputs. Within this organization, major LLM failures, including hallucination, bias, refusal failure and sycophancy, correspond to distinct disruptions in representational and behavioural-control systems, yielding internal signatures for mechanism-guided detection and targeted intervention. Beyond model behaviour, NeuroCogMap improves prediction of human cortical responses during naturalistic language comprehension, with the strongest correspondence in higher-order association cortex. At the cognitive level, its internal signatures expose latent strategies that guide refinements of classical models of human decision-making. Together, these findings establish NeuroCogMap as a system-level framework for mapping functional organization in artificial systems and for relating this organization to human cortical function and cognitive behaviour.