Overdraagbaarheid voor algemeen redeneren: een geautomatiseerd curriculum voor multi-domein RLVR
Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR
June 27, 2026
Auteurs: Yongjin Yang, Jiarui Liu, Yinghui He, Lechen Zhang, Bernhard Schölkopf, Zhijing Jin
cs.AI
Samenvatting
Reinforcement learning met verifieerbare beloningen (RLVR) is uitgebreid van enkelvoudige domeintraining naar multi-domein redeneersuites die wiskunde, programmeren en natuurwetenschappen omvatten. Het trainingscurriculum (hoe vaak elk domein wordt gesampled) is echter doorgaans vast of handmatig afgesteld, terwijl redeneervaardigheden ongelijkmatig overdragen tussen domeinen. Bestaande leerbaarheidsgebaseerde curricula passen zich aan waar het beleid op dat moment verbetert, maar zijn blind voor de vraag of een gradiëntstap op het geselecteerde domein de overige domeinen ten goede komt. In dit artikel stellen we Transfer-Aware Curriculum (TAC) voor, een bandiet-stijl online curriculum dat prioriteit geeft aan domeinen waarvan de updates breed ten goede komen aan de rest van de trainingssuite. TAC hergebruikt signalen die al door RL-training worden geproduceerd: per-domein voordelen vangen lokale leerbaarheid op, en geprojecteerde gradiënten, ontleend aan de GRPO-stap die wordt berekend, schatten de overdraagbaarheid tussen domeinen via gradiënt-geometrie-uitlijning, tegen verwaarloosbare kosten (<1% wandklokoverhead). In een redeneersuite van zes domeinen behaalt TAC de beste macro-gemiddelde nauwkeurigheid op zowel Qwen3-1.7B als Llama3.2-3B, en presteert het beter dan proportionele willekeurige sampling, een handmatig ontworpen schema en een uitsluitend op leerbaarheid gebaseerde bandiet, met een verbetering tot 2,8 punten (10% relatief) ten opzichte van deze laatste. Ablaties tonen aan dat de prestaties sterk afnemen wanneer de overdraagbaarheidsterm wordt verwijderd, en TAC blijft robuust bij onevenwichtige trainingsmengsels waar uitsluitend op leerbaarheid gebaseerde curricula overmatig inzetten op dominante domeinen. Onze bevindingen vestigen overdraagbaarheid tussen domeinen als een belangrijk signaal voor curriculumontwerp in multi-domein RLVR.
English
Reinforcement learning with verifiable rewards (RLVR) has been extended from single-domain training to multi-domain reasoning suites spanning mathematics, programming, and science. However, the training curriculum (how often each domain is sampled) is typically fixed or hand-tuned, even though reasoning skills transfer unevenly across domains. Existing learnability-based curricula adapt to where the policy is currently improving, but are blind to whether a gradient step on the selected domain benefits the remaining domains. In this paper, we propose Transfer-Aware Curriculum (TAC), a bandit-style online curriculum that prioritizes domains whose updates broadly benefit the rest of the training suite. TAC repurposes signals already produced by RL training: per-domain advantages capture local learnability, and projected gradients, taken from the GRPO step being computed, estimate cross-domain transferability via gradient-geometry alignment, at negligible cost (<1% wall-clock overhead). Across a six-domain reasoning suite, TAC achieves the best macro-averaged accuracy on both Qwen3-1.7B and Llama3.2-3B, outperforming proportional random sampling, a hand-designed schedule, and a learnability-only bandit, and improving over the last of these by up to 2.8 points (10% relative). Ablations show performance degrades sharply when the transferability term is removed, and TAC remains robust on imbalanced training mixtures where learnability-only curricula over-commit to dominant domains. Our findings establish cross-domain transferability as a key signal for curriculum design in multi-domain RLVR.