ChatPaper.aiChatPaper

Meten we strategie of formulering? De kloof tussen diversiteit op oppervlakte- en aanpakniveau in wiskundig redeneren van LLM's

Are We Measuring Strategy or Phrasing? The Gap Between Surface- and Approach-Level Diversity in LLM Math Reasoning

June 29, 2026
Auteurs: Sangmook Lee, Minbeom Kim, Jeonghye Kim, Dohyung Kim, Sojeong Rhee, Kyomin Jung
cs.AI

Samenvatting

Diversiteit in wiskundige redenering van LLM’s is van cruciaal belang voor exploratie, maar gangbare diversiteitsstatistieken vangen meestal alleen variatie op het oppervlakteniveau in plaats van verschillen in hoe een probleem wordt opgelost. Wij vullen deze leemte door diversiteit op aanpakniveau te introduceren: variatie in strategieën tussen correcte oplossingen voor hetzelfde probleem. Gebruikmakend van een door mensen gekalibreerd LLM-beoordelingskader tonen we aan dat eerdere diversiteitsmetingen onbetrouwbare proxies zijn voor diversiteit op aanpakniveau, en dat deze discrepantie doorwerkt in diversiteitsbewuste RLVR, waar doelstatistieken behouden blijven terwijl de diversiteit op aanpakniveau afneemt. Door te onderzoeken wanneer diversiteit op aanpakniveau helpt en of deze direct kan worden geïnduceerd, vinden we dat aanpak-diverse kandidaatsets de schaling tijdens het testen verbeteren. Het optimaliseren van een LLM-beoordelaarsdiversiteitsbeloning tijdens de training zorgt er echter voor dat het beleid beoordelaarspecifieke voorkeuren uitbuit in plaats van zijn aanpakken te verbreden, waardoor directe optimalisatie van diversiteit op aanpakniveau een open probleem blijft. Samen introduceert ons werk het concept van diversiteit op aanpakniveau en onthult het een systematische divergentie tussen signalen op oppervlakte- en aanpakniveau, wat een stap markeert naar LLM’s die op een werkelijk diverse, menselijke manier redeneren.
English
Diversity in LLM mathematical reasoning is critical for exploration, but common diversity metrics mostly capture surface-level variation rather than differences in how a problem is solved. We address this gap by introducing approach-level diversity: variation in strategies across correct solutions to the same problem. Using a human-calibrated LLM judge framework, we show that prior diversity measures are unreliable proxies for approach-level diversity, and this mismatch carries over to diversity-aware RLVR, where target metrics are preserved while approach-level diversity declines. Investigating when approach-level diversity helps and whether it can be directly induced, we find that approach-diverse candidate sets improve test-time scaling. However, optimizing an LLM judge diversity reward during training causes the policy to exploit judge-specific preferences rather than broaden its approaches, leaving direct optimization of approach-level diversity as an open problem. Together, our work introduces the notion of approach-level diversity and uncovers a systematic divergence between surface- and approach-level signals, marking a step toward LLMs that reason in genuinely diverse, human-like ways.