Estamos Medindo Estratégia ou Formulação? A Lacuna entre a Diversidade de Nível Superficial e de Nível de Abordagem no Raciocínio Matemático de LLMs
Are We Measuring Strategy or Phrasing? The Gap Between Surface- and Approach-Level Diversity in LLM Math Reasoning
June 29, 2026
Autores: Sangmook Lee, Minbeom Kim, Jeonghye Kim, Dohyung Kim, Sojeong Rhee, Kyomin Jung
cs.AI
Resumo
A diversidade no raciocínio matemático de LLMs é crítica para a exploração, mas métricas comuns de diversidade capturam majoritariamente variações superficiais, e não diferenças na forma como um problema é resolvido. Abordamos essa lacuna introduzindo a diversidade em nível de abordagem: variação nas estratégias entre soluções corretas para um mesmo problema. Utilizando uma estrutura de avaliador LLM calibrada por humanos, demonstramos que medidas anteriores de diversidade são proxies não confiáveis para a diversidade em nível de abordagem, e essa incompatibilidade se estende ao RLVR consciente de diversidade, onde as métricas-alvo são preservadas enquanto a diversidade em nível de abordagem diminui. Investigando quando a diversidade em nível de abordagem é benéfica e se pode ser induzida diretamente, descobrimos que conjuntos de candidatos com diversidade de abordagem melhoram o escalonamento em tempo de teste. No entanto, otimizar uma recompensa de diversidade do avaliador LLM durante o treinamento faz com que a política explore preferências específicas do avaliador em vez de ampliar suas abordagens, deixando a otimização direta da diversidade em nível de abordagem como um problema em aberto. Em conjunto, nosso trabalho introduz o conceito de diversidade em nível de abordagem e revela uma divergência sistemática entre sinais de superfície e de abordagem, representando um passo em direção a LLMs que raciocinam de formas genuinamente diversas e semelhantes às humanas.
English
Diversity in LLM mathematical reasoning is critical for exploration, but common diversity metrics mostly capture surface-level variation rather than differences in how a problem is solved. We address this gap by introducing approach-level diversity: variation in strategies across correct solutions to the same problem. Using a human-calibrated LLM judge framework, we show that prior diversity measures are unreliable proxies for approach-level diversity, and this mismatch carries over to diversity-aware RLVR, where target metrics are preserved while approach-level diversity declines. Investigating when approach-level diversity helps and whether it can be directly induced, we find that approach-diverse candidate sets improve test-time scaling. However, optimizing an LLM judge diversity reward during training causes the policy to exploit judge-specific preferences rather than broaden its approaches, leaving direct optimization of approach-level diversity as an open problem. Together, our work introduces the notion of approach-level diversity and uncovers a systematic divergence between surface- and approach-level signals, marking a step toward LLMs that reason in genuinely diverse, human-like ways.