ChatPaper.aiChatPaper

Ring-Zero: Opschaling van Zero RL naar een biljoen parameters voor emergente redenering

Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

July 14, 2026
Auteurs: Xinyu Tang, Gangqiang Cao, Yurou Liu, Yuliang Zhan, Xiaochong Lan, Yifan Li, Yuchen Yan, Han Peng, Zican Dong, Zhenduo Zhang, Tianshu Wang, Xinyu Kong, Zujie Wen, Wayne Xin Zhao, Zhiqiang Zhang, Jun Zhou
cs.AI

Samenvatting

Reinforcement learning met verifieerbare beloningen zonder menselijk geannoteerde data, vaak aangeduid als zero RL, is naar voren gekomen als een krachtig paradigma voor het ontlokken van keten-van-gedachte-redeneringen. Vanwege computationele beperkingen zijn bestaande studies echter grotendeels beperkt tot kleine modellen, waardoor de trainingsdynamiek en emergente vermogens op grote schaal onontgonnen blijven. Om deze grens op een zinvolle manier te verkennen, streven we ernaar om hoogwaardige redeneergedragingen uit het model te ontlokken. We constateren echter dat naïeve opschaling vaak lijdt onder slechte leesbaarheid, tokenredundantie en een gebrek aan adaptieve redeneerdiepte. Om deze uitdagingen aan te pakken, presenteren we een stabiele en efficiënte trainingspijplijn, waarin algoritmische en systeemoptimalisaties zijn geïntegreerd, zoals geknipte importance sampling, correctie van de trainings-inferentieverhouding en gemengde-precisiecontrole. Onze experimenten leveren drie belangrijke bevindingen op die de 'bittere les' van opschaling bevestigen: (1) opschaling naar 1 biljoen parameters verbetert de steekproefefficiëntie en prestatielimieten aanzienlijk; (2) het trainingsproces verloopt opeenvolgend via een initiële ontdekkingsfase gevolgd door een aanscherpingsfase; en (3) het model ontwikkelt spontaan geavanceerde cognitieve gedragingen, waaronder antropomorfisme, gestructureerde opmaak, zelfverificatie, parallel redeneren en contextangst, waardoor handgemaakte heuristieken overbodig worden. Op zeven wiskundige benchmarks bereikt Ring-2.5-1T-Zero concurrerende prestaties. Daarnaast stellen we, om de CoT-kwaliteit verder te beoordelen dan alleen de juistheid van het eindantwoord, een gestructureerd evaluatiekader voor over drie dimensies: begrijpelijkheid, reproduceerbaarheid en efficiëntie, waarbij ons model duidelijke voordelen laat zien in het produceren van gestructureerde en beknopte redeneersporen. Door onze waargenomen emergente verschijnselen te delen, hopen we de onderzoeksgemeenschap diepere inzichten te verschaffen in opschalingsgedrag, met name op de schaal van 1 biljoen.
English
Reinforcement learning with verifiable rewards without human-annotated data, often referred to as zero RL, has emerged as a powerful paradigm for eliciting chain-of-thought reasoning. However, due to computational constraints, existing studies are largely restricted to small models, leaving the training dynamics and emergent capabilities at a large scale unexplored. To meaningfully explore this frontier, we aim to elicit high-quality reasoning behaviors from the model. However, we find that naive scaling often suffers from poor readability, token redundancy, and a lack of adaptive reasoning depth. To address these challenges, we present a stable and efficient training pipeline, incorporating algorithmic and system optimizations such as clipped importance sampling, training-inference ratio correction, and mixed-precision control. Our experiments offer three key findings that validate the "bitter lesson" of scaling: (1) scaling to 1T parameters significantly enhances sample efficiency and performance ceilings; (2) the training process progresses sequentially through an initial discovery phase followed by a sharpening phase; and (3) the model spontaneously develops advanced cognitive behaviors, including anthropomorphism, structured formatting, self-verification, parallel reasoning, and context anxiety, rendering hand-crafted heuristics redundant. Evaluated on seven mathematical benchmarks, Ring-2.5-1T-Zero achieves competitive performance. Additionally, to assess CoT quality beyond final-answer correctness, we propose a structured evaluation framework across three dimensions: comprehensibility, reproducibility, and efficiency, where our model demonstrates clear advantages in producing structured and concise reasoning traces. By sharing our observed emergent phenomena, we hope to provide the community with deeper insights into scaling behaviors, particularly at the 1-trillion scale.