NeuroCogMap раскрывает когнитивную организацию больших языковых моделей
NeuroCogMap Reveals Cognitive Organization of Large Language Models
July 1, 2026
Авторы: Zhongxiang Sun, Haolang Lu, Qiang Ma, Qi Li, Qipeng Wang, Liang Pang, Chenyu Liu, Qiankun Li, Hao Sun, Kun Wang, Yi Zeng, Jun Xu, Guoqi Li, Ji-Rong Wen
cs.AI
Аннотация
Понимание того, как сложные когнитивные функции организованы в искусственных системах, является ключевым для интерпретации больших языковых моделей (LLM) и их соотнесения с биологическим познанием. Однако, несмотря на то что LLM демонстрируют широкий спектр когнитивноподобного поведения, остается неясным, образуют ли их внутренние представления воспроизводимые функциональные системы, которые объясняют поведение, сбои и связи с человеческим познанием. Здесь мы представляем NeuroCogMap — основанную на когнитивной нейронауке методологию, которая организует внутренние характеристики LLM в функциональные участки и связывает их с интерпретируемыми функциями, когнитивными способностями и когнитивной иерархией. Эти участки образуют стабильную и семантически согласованную организацию, которая частично сохраняется между моделями и функционально связана с выходами моделей. В рамках этой организации основные сбои LLM, включая галлюцинации, предвзятость, отказ от ответа и подхалимство, соответствуют различным нарушениям в системах репрезентации и поведенческого контроля, что дает внутренние сигнатуры для детекции, основанной на механизмах, и целенаправленного вмешательства. Помимо поведения модели, NeuroCogMap улучшает предсказание корковых реакций человека при естественном понимании языка, причем наиболее сильное соответствие наблюдается в ассоциативной коре высшего порядка. На когнитивном уровне его внутренние сигнатуры раскрывают скрытые стратегии, которые направляют усовершенствования классических моделей принятия решений человеком. В совокупности эти результаты утверждают NeuroCogMap как системный подход для картирования функциональной организации в искусственных системах и для соотнесения этой организации с корковой функцией человека и когнитивным поведением.
English
Understanding how complex cognitive functions are organized within artificial systems is central to interpreting large language models (LLMs) and relating them to biological cognition. Yet although LLMs exhibit broad cognitive-like behaviours, it remains unclear whether their internal representations form reproducible functional systems that explain behaviour, failure and links to human cognition. Here we present NeuroCogMap, a cognitive neuroscience-inspired framework that organizes internal features of LLMs into functional parcels and links them to interpretable functions, cognitive capabilities and a cognitive hierarchy. These parcels form a stable and semantically coherent organization that is partly conserved across models and functionally linked to model outputs. Within this organization, major LLM failures, including hallucination, bias, refusal failure and sycophancy, correspond to distinct disruptions in representational and behavioural-control systems, yielding internal signatures for mechanism-guided detection and targeted intervention. Beyond model behaviour, NeuroCogMap improves prediction of human cortical responses during naturalistic language comprehension, with the strongest correspondence in higher-order association cortex. At the cognitive level, its internal signatures expose latent strategies that guide refinements of classical models of human decision-making. Together, these findings establish NeuroCogMap as a system-level framework for mapping functional organization in artificial systems and for relating this organization to human cortical function and cognitive behaviour.