Cognitieve episodes in redeneersporen van LLM's maken interpreteerbare voorspelling van menselijke itemmoeilijkheid mogelijk.
Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction
June 26, 2026
Auteurs: Chenguang Wang, Ming Li, Xinyue Zeng, Zhuochun Li, Hong Jiao, Tianyi Zhou, Dawei Zhou
cs.AI
Samenvatting
Het voorspellen van de moeilijkheid van items voor mensen staat centraal in onderwijsbeoordeling, waarbij betrouwbare schattingen bijdragen aan eerlijkheid en effectieve toetsconstructie. Bestaande methoden zijn vaak afhankelijk van kostbare menselijke kalibratie of tekstuele representaties op itemniveau, en bieden beperkt inzicht in de cognitieve processen die items moeilijk maken. Wij stellen dat moeilijkheid niet alleen moet worden gezien als een eigenschap van de itemtekst, maar ook als een waarneembaar gevolg van de probleemoplossende belasting die een item met zich meebrengt. Grote Redeneermodellen (GRM's) bieden schaalbare procesinformatie via redeneersporen, maar dergelijke informatie moet gestructureerd worden om interpreteerbare modellering te ondersteunen. Daartoe introduceren wij Epi2Diff (Episode to Difficulty), een raamwerk dat redeneersporen van GRM's omzet in cognitief gefundeerde episodesequenties. Deze episodes groeperen spoorsegmenten in functionele probleemoplossende toestanden, waardoor moeilijkheid gemodelleerd kan worden aan de hand van redeneerschaal, inspanningsallocatie en toestandsovergangen. Epi2Diff extraheert compacte episodedynamische kenmerken en combineert deze met semantische itemrepresentaties voor de voorspelling van menselijke moeilijkheid. Experimenten op vier realistische datasets van menselijke moeilijkheid tonen aan dat Epi2Diff consequent beter presteert dan sterke baselines, waaronder fijn afgestemde kleine taalmodellen, LLM-in-contextleren en gesuperviseerde LLM-aanpassing. Op van SAT afgeleide classificatiebenchmarks behaalt Epi2Diff een gemiddelde relatieve winst van 8,1% ten opzichte van gesuperviseerde LLM-fijnafstemmingsbaselines. Verdere analyses tonen aan dat moeilijkere items meer inspanningrijke, iteratieve en implementatiegerichte episodedynamiek induceren, en niet simpelweg langere antwoorden. Deze resultaten laten zien dat cognitieve episodes in redeneersporen van GRM's een voorspellende en interpreteerbare procesrepresentatie bieden voor menselijke itemmoeilijkheid, en een nieuw perspectief bieden voor onderwijsmeting met redeneermodellen.
English
Predicting human item difficulty is central to educational assessment, where reliable estimates support fairness and effective test construction. Existing methods often depend on costly human calibration or item-level textual representations, providing limited evidence about the cognitive processes that make items difficult. We argue that difficulty should be viewed not only as a property of item text, but also as an observable consequence of the problem-solving burden an item induces. Large Reasoning Models (LRMs) offer scalable process evidence through reasoning traces, but such evidence must be structured to support interpretable modeling. To this end, we introduce Epi2Diff (Episode to Difficulty), a framework that maps LRM reasoning traces into cognitively grounded episode sequences. These episodes group trace segments into functional problem-solving states, enabling difficulty to be modeled through reasoning scale, effort allocation, and state transitions. Epi2Diff extracts compact episode-dynamic features and combines them with semantic item representations for human difficulty prediction. Experiments on four real-world human difficulty datasets show that Epi2Diff consistently outperforms strong baselines, including fine-tuned small language models, LLM in-context learning, and supervised LLM adaptation. On SAT-derived classification benchmarks, Epi2Diff achieves an 8.1% average relative gain over supervised LLM fine-tuning baselines. Further analyses show that harder items induce more effortful, iterative, and implementation-centered episode dynamics, rather than merely longer responses. These results demonstrate that cognitive episodes in LRM reasoning traces provide a predictive and interpretable process representation for human item difficulty, offering a new lens for educational measurement with reasoning models.