Transferibilidade para Raciocínio Geral: Um Currículo Automatizado para RLVR Multi-Domínio
Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR
June 27, 2026
Autores: Yongjin Yang, Jiarui Liu, Yinghui He, Lechen Zhang, Bernhard Schölkopf, Zhijing Jin
cs.AI
Resumo
Aprendizagem por reforço com recompensas verificáveis (ARV) foi estendida do treinamento em domínio único para conjuntos de raciocínio multidomínio abrangendo matemática, programação e ciências. No entanto, o currículo de treinamento (com que frequência cada domínio é amostrado) é tipicamente fixo ou ajustado manualmente, mesmo que as habilidades de raciocínio sejam transferidas de forma desigual entre os domínios. Os currículos existentes baseados em aprendibilidade adaptam-se ao local onde a política está atualmente melhorando, mas são cegos para saber se um passo de gradiente no domínio selecionado beneficia os demais domínios. Neste artigo, propomos o Currículo Ciente de Transferência (CCT), um currículo online estilo bandido que prioriza domínios cujas atualizações beneficiam amplamente o restante do conjunto de treinamento. O CCT reaproveita sinais já produzidos pelo treinamento AR: as vantagens por domínio capturam a aprendibilidade local, e os gradientes projetados, obtidos a partir da etapa GRPO que está sendo calculada, estimam a transferibilidade entre domínios via alinhamento geométrico de gradientes, a um custo desprezível (<1% de sobrecarga de tempo de relógio). Em um conjunto de raciocínio de seis domínios, o CCT alcança a melhor acurácia macro-média tanto no Qwen3-1.7B quanto no Llama3.2-3B, superando a amostragem aleatória proporcional, um cronograma projetado manualmente e um bandido apenas de aprendibilidade, e melhorando sobre este último em até 2,8 pontos (10% relativo). Ablações mostram que o desempenho degrada acentuadamente quando o termo de transferibilidade é removido, e o CCT permanece robusto em misturas de treinamento desbalanceadas onde currículos apenas de aprendibilidade se comprometem excessivamente com domínios dominantes. Nossos achados estabelecem a transferibilidade entre domínios como um sinal chave para o design de currículos em ARV multidomínio.
English
Reinforcement learning with verifiable rewards (RLVR) has been extended from single-domain training to multi-domain reasoning suites spanning mathematics, programming, and science. However, the training curriculum (how often each domain is sampled) is typically fixed or hand-tuned, even though reasoning skills transfer unevenly across domains. Existing learnability-based curricula adapt to where the policy is currently improving, but are blind to whether a gradient step on the selected domain benefits the remaining domains. In this paper, we propose Transfer-Aware Curriculum (TAC), a bandit-style online curriculum that prioritizes domains whose updates broadly benefit the rest of the training suite. TAC repurposes signals already produced by RL training: per-domain advantages capture local learnability, and projected gradients, taken from the GRPO step being computed, estimate cross-domain transferability via gradient-geometry alignment, at negligible cost (<1% wall-clock overhead). Across a six-domain reasoning suite, TAC achieves the best macro-averaged accuracy on both Qwen3-1.7B and Llama3.2-3B, outperforming proportional random sampling, a hand-designed schedule, and a learnability-only bandit, and improving over the last of these by up to 2.8 points (10% relative). Ablations show performance degrades sharply when the transferability term is removed, and TAC remains robust on imbalanced training mixtures where learnability-only curricula over-commit to dominant domains. Our findings establish cross-domain transferability as a key signal for curriculum design in multi-domain RLVR.