Bandidos em Variedades: Aprendizagem Curricular Bayesiana sobre a Geometria Latente de Grandes Modelos de Linguagem
Manifold Bandits: Bayesian Curriculum Learning over the Latent Geometry of Large Language Models
June 18, 2026
Autores: Darrien McKenzie, Nicklas Hansen, Xiaolong Wang
cs.AI
Resumo
A aprendizagem por reforço (RL) é uma abordagem central para melhorar as capacidades de raciocínio em modelos de linguagem de grande porte (LLMs), onde a eficiência do treinamento depende criticamente de como os problemas são amostrados durante a otimização. Métodos existentes de aprendizagem curricular adaptativa tipicamente priorizam prompts de dificuldade intermediária, tratando a seleção de problemas como um problema de bandido padrão com braços independentes e ignorando a natureza estruturada e heterogênea do espaço de tarefas. Neste trabalho, enquadramos a amostragem de problemas como um problema de bandido com estrutura de variedade e não estacionariedade endógena: os problemas estão relacionados através do espaço de representação latente do modelo, e as decisões de amostragem podem direcionar como os sinais de aprendizado evoluem nesse espaço. Para operacionalizar essa perspectiva, introduzimos o Currículo Bayesiano de Variedade (BMC), um arcabouço ciente da estrutura que organiza os problemas em uma árvore hierárquica de tarefas e aplica a aprendizagem bayesiana para guiar a amostragem. Empiricamente, descobrimos que diferentes estratégias de amostragem induzem compromissos não triviais entre produtividade (sinal de aprendizado), diversidade (cobertura da variedade de tarefas) e utilidade (relevância para avaliação). Esses resultados mostram que priorizar apenas a dificuldade é insuficiente para um bom desempenho downstream, destacando a importância de incorporar consciência de estrutura e tipo na amostragem de problemas.
English
Reinforcement learning (RL) is a central approach for improving reasoning capabilities in large language models (LLMs), where training efficiency depends critically on how problems are sampled during optimization. Existing adaptive curriculum learning methods typically prioritize prompts of intermediate difficulty, treating problem selection as a standard bandit problem with independent arms and overlooking the structured, heterogeneous nature of the task space. In this work, we frame problem sampling as a manifold-structured bandit problem with endogenous non-stationarity: problems are related through the model's latent representation space, and sampling decisions can steer how learning signals evolve across that space. To operationalize this perspective, we introduce Bayesian Manifold Curriculum (BMC), a structure-aware framework that organizes problems into a hierarchical task tree and applies Bayesian learning to guide sampling. Empirically, we find that different sampling strategies induce non-trivial tradeoffs between productivity (learning signal), diversity (coverage of the task manifold), and utility (evaluation relevance). These results show that prioritizing difficulty alone is insufficient for strong downstream performance, highlighting the importance of incorporating structure and type-awareness into problem sampling.