ChatPaper.aiChatPaper

Kunnen MLLM's de gedachten van studenten lezen? Een ontleding van multimodale foutenanalyse in handgeschreven wiskunde.

Can MLLMs Read Students' Minds? Unpacking Multimodal Error Analysis in Handwritten Math

March 26, 2026
Auteurs: Dingjie Song, Tianlong Xu, Yi-Fan Zhang, Hang Li, Zhiling Yan, Xing Fan, Haoyang Li, Lichao Sun, Qingsong Wen
cs.AI

Samenvatting

Het beoordelen van handgeschreven kladwerk van studenten is cruciaal voor gepersonaliseerde educatieve feedback, maar brengt unieke uitdagingen met zich mee vanwege divers handschrift, complexe lay-outs en uiteenlopende oplossingsstrategieën. Bestaand educatief NLP-onderzoek richt zich voornamelijk op tekstuele antwoorden en negeert de complexiteit en multimodaliteit die inherent zijn aan authentiek handgeschreven kladwerk. Huidige multimodale grote taalmodellen (MLLM's) blinken uit in visueel redeneren, maar hanteren typisch een "examendeelnemersperspectief" door prioriteit te geven aan het genereren van correcte antwoorden in plaats van het diagnosticeren van studentenfouten. Om deze kloof te overbruggen, introduceren we ScratchMath, een nieuwe benchmark specifiek ontworpen voor het verklaren en classificeren van fouten in authentiek handgeschreven wiskundig kladwerk. Onze dataset omvat 1.720 wiskundige voorbeelden van Chinese basisschool- en middelbare schoolleerlingen, en ondersteunt twee kerntaken: Foutoorzaakverklaring (ECE) en Foutoorzaakclassificatie (ECC), met zeven gedefinieerde fouttypes. De dataset is nauwkeurig geannoteerd via rigoureuze mens-machine samenwerkingsmethoden met meerdere fasen van expertlabeling, review en verificatie. We evalueren systematisch 16 toonaangevende MLLM's op ScratchMath, wat significante prestatiekloofen ten opzichte van menselijke experts aan het licht brengt, vooral in visuele herkenning en logisch redeneren. Propriëtaire modellen presteren opmerkelijk beter dan open-source modellen, waarbij grote redeneermodellen sterk potentieel tonen voor foutverklaring. Alle evaluatiedata en -frameworks zijn openbaar beschikbaar om verder onderzoek te faciliteren.
English
Assessing student handwritten scratchwork is crucial for personalized educational feedback but presents unique challenges due to diverse handwriting, complex layouts, and varied problem-solving approaches. Existing educational NLP primarily focuses on textual responses and neglects the complexity and multimodality inherent in authentic handwritten scratchwork. Current multimodal large language models (MLLMs) excel at visual reasoning but typically adopt an "examinee perspective", prioritizing generating correct answers rather than diagnosing student errors. To bridge these gaps, we introduce ScratchMath, a novel benchmark specifically designed for explaining and classifying errors in authentic handwritten mathematics scratchwork. Our dataset comprises 1,720 mathematics samples from Chinese primary and middle school students, supporting two key tasks: Error Cause Explanation (ECE) and Error Cause Classification (ECC), with seven defined error types. The dataset is meticulously annotated through rigorous human-machine collaborative approaches involving multiple stages of expert labeling, review, and verification. We systematically evaluate 16 leading MLLMs on ScratchMath, revealing significant performance gaps relative to human experts, especially in visual recognition and logical reasoning. Proprietary models notably outperform open-source models, with large reasoning models showing strong potential for error explanation. All evaluation data and frameworks are publicly available to facilitate further research.