ChatPaper.aiChatPaper

Episódios Cognitivos em Rastros de Raciocínio de LLM Permitem Predição Interpretável de Dificuldade de Itens Humanos

Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction

June 26, 2026
Autores: Chenguang Wang, Ming Li, Xinyue Zeng, Zhuochun Li, Hong Jiao, Tianyi Zhou, Dawei Zhou
cs.AI

Resumo

Prever a dificuldade de itens humanos é central para a avaliação educacional, onde estimativas confiáveis apoiam a equidade e a construção eficaz de testes. Métodos existentes frequentemente dependem de calibração humana custosa ou de representações textuais no nível do item, fornecendo evidências limitadas sobre os processos cognitivos que tornam os itens difíceis. Argumentamos que a dificuldade deve ser vista não apenas como uma propriedade do texto do item, mas também como uma consequência observável da carga de resolução de problemas que um item impõe. Modelos de Raciocínio em Grande Escala (LRMs) oferecem evidências processuais escaláveis por meio de traços de raciocínio, mas tais evidências precisam ser estruturadas para modelagem interpretável. Para esse fim, introduzimos o Epi2Diff (Episódio para Dificuldade), uma estrutura que mapeia traços de raciocínio de LRMs em sequências de episódios fundamentados cognitivamente. Esses episódios agrupam segmentos de traços em estados funcionais de resolução de problemas, permitindo que a dificuldade seja modelada por meio da escala de raciocínio, alocação de esforço e transições de estado. O Epi2Diff extrai características compactas de dinâmica de episódios e as combina com representações semânticas de itens para previsão de dificuldade humana. Experimentos em quatro conjuntos de dados reais de dificuldade humana mostram que o Epi2Diff supera consistentemente linhas de base fortes, incluindo modelos de linguagem pequenos ajustados, aprendizado em contexto de LLM e adaptação supervisionada de LLM. Em benchmarks de classificação derivados do SAT, o Epi2Diff alcança um ganho relativo médio de 8,1% sobre as linhas de base de ajuste fino supervisionado de LLM. Análises adicionais mostram que itens mais difíceis induzem dinâmicas de episódios mais esforçadas, iterativas e centradas na implementação, em vez de apenas respostas mais longas. Esses resultados demonstram que episódios cognitivos em traços de raciocínio de LRMs fornecem uma representação processual preditiva e interpretável para a dificuldade de itens humanos, oferecendo uma nova perspectiva para a medição educacional com modelos de raciocínio.
English
Predicting human item difficulty is central to educational assessment, where reliable estimates support fairness and effective test construction. Existing methods often depend on costly human calibration or item-level textual representations, providing limited evidence about the cognitive processes that make items difficult. We argue that difficulty should be viewed not only as a property of item text, but also as an observable consequence of the problem-solving burden an item induces. Large Reasoning Models (LRMs) offer scalable process evidence through reasoning traces, but such evidence must be structured to support interpretable modeling. To this end, we introduce Epi2Diff (Episode to Difficulty), a framework that maps LRM reasoning traces into cognitively grounded episode sequences. These episodes group trace segments into functional problem-solving states, enabling difficulty to be modeled through reasoning scale, effort allocation, and state transitions. Epi2Diff extracts compact episode-dynamic features and combines them with semantic item representations for human difficulty prediction. Experiments on four real-world human difficulty datasets show that Epi2Diff consistently outperforms strong baselines, including fine-tuned small language models, LLM in-context learning, and supervised LLM adaptation. On SAT-derived classification benchmarks, Epi2Diff achieves an 8.1% average relative gain over supervised LLM fine-tuning baselines. Further analyses show that harder items induce more effortful, iterative, and implementation-centered episode dynamics, rather than merely longer responses. These results demonstrate that cognitive episodes in LRM reasoning traces provide a predictive and interpretable process representation for human item difficulty, offering a new lens for educational measurement with reasoning models.