ChatPaper.aiChatPaper

EDU-CIRCUIT-HW: Avaliação de Modelos de Linguagem Multimodais de Grande Escala em Soluções Manuscritas de Estudantes Universitários de STEM do Mundo Real

EDU-CIRCUIT-HW: Evaluating Multimodal Large Language Models on Real-World University-Level STEM Student Handwritten Solutions

April 30, 2026
Autores: Weiyu Sun, Liangliang Chen, Yongnuo Cai, Huiru Xie, Yi Zeng, Ying Zhang
cs.AI

Resumo

Os Modelos de Linguagem Multimodais de Grande Escala (MLLMs) apresentam um potencial significativo para revolucionar o ensino tradicional e reduzir a carga de trabalho dos professores. No entanto, a interpretação precisa de soluções manuscritas não restritas de estudantes de STEM, que intercalam fórmulas matemáticas, diagramas e raciocínios textuais, representa um desafio considerável devido à falta de benchmarks autênticos e específicos do domínio. Adicionalmente, os paradigmas de avaliação atuais baseiam-se predominantemente nos resultados de tarefas subsequentes (por exemplo, correção automática), que frequentemente analisam apenas um subconjunto do conteúdo reconhecido, falhando assim em capturar a compreensão dos MLLMs da lógica manuscrita complexa como um todo. Para colmatar esta lacuna, disponibilizamos o EDU-CIRCUIT-HW, um conjunto de dados composto por mais de 1300 soluções manuscritas autênticas de estudantes de um curso universitário de STEM. Utilizando as transcrições verbatim verificadas por especialistas e os relatórios de correção das soluções dos estudantes, avaliamos simultaneamente a fidelidade do reconhecimento a montante e o desempenho da correção automática a jusante de vários MLLMs. A nossa avaliação revela uma escala surpreendente de falhas latentes no conteúdo manuscrito dos estudantes reconhecido pelos MLLMs, destacando a fiabilidade insuficiente dos modelos para correção automática e outras aplicações orientadas à compreensão em contextos educacionais de alto impacto. Como uma solução potencial, apresentamos um estudo de caso que demonstra que a utilização de padrões de erro identificados para detetar e corrigir proativamente erros de reconhecimento, exigindo apenas uma intervenção humana mínima (por exemplo, encaminhando 3,3% dos trabalhos para corretores humanos e os restantes para o corretor GPT-5.1), pode melhorar eficazmente a robustez do sistema de correção assistida por IA implementado. O código e o conjunto de dados estão disponíveis neste repositório GitHub: https://gt-learning-innovation.github.io/CIRCUIT_EDU_HW_ACL.
English
Multimodal Large Language Models (MLLMs) hold significant promise for revolutionizing traditional education and reducing teachers' workload. However, accurately interpreting unconstrained STEM student handwritten solutions with intertwined mathematical formulas, diagrams, and textual reasoning poses a significant challenge due to the lack of authentic and domain-specific benchmarks. Additionally, current evaluation paradigms predominantly rely on the outcomes of downstream tasks (e.g., auto-grading), which often probe only a subset of the recognized content, thereby failing to capture the MLLMs' understanding of complex handwritten logic as a whole. To bridge this gap, we release EDU-CIRCUIT-HW, a dataset consisting of 1,300+ authentic student handwritten solutions from a university-level STEM course. Utilizing the expert-verified verbatim transcriptions and grading reports of student solutions, we simultaneously evaluate various MLLMs' upstream recognition fidelity and downstream auto-grading performance. Our evaluation uncovers an astonishing scale of latent failures within MLLM-recognized student handwritten content, highlighting the models' insufficient reliability for auto-grading and other understanding-oriented applications in high-stakes educational settings. As a potential solution, we present a case study demonstrating that leveraging identified error patterns to preemptively detect and correct recognition errors, while requiring only minimal human intervention (e.g., routing 3.3% of assignments to human graders and the remainder to the GPT-5.1 grader), can effectively enhance the robustness of the deployed AI-enabled grading system. Code and dataset are available in this GitHub repo: https://gt-learning-innovation.github.io/CIRCUIT_EDU_HW_ACL.