Ring-Zero: Skalierung von Zero RL auf eine Billion Parameter für emergentes Schließen
Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
July 14, 2026
Autoren: Xinyu Tang, Gangqiang Cao, Yurou Liu, Yuliang Zhan, Xiaochong Lan, Yifan Li, Yuchen Yan, Han Peng, Zican Dong, Zhenduo Zhang, Tianshu Wang, Xinyu Kong, Zujie Wen, Wayne Xin Zhao, Zhiqiang Zhang, Jun Zhou
cs.AI
Zusammenfassung
Bestärkendes Lernen mit überprüfbaren Belohnungen ohne menschlich annotierte Daten, oft als Zero RL bezeichnet, hat sich als leistungsfähiges Paradigma zur Gewinnung von Chain-of-Thought-Reasoning etabliert. Aufgrund rechenintensiver Einschränkungen beschränken sich bestehende Studien jedoch weitgehend auf kleine Modelle, sodass die Trainingsdynamiken und emergenten Fähigkeiten im großen Maßstab unerforscht bleiben. Um diese Grenzen sinnvoll zu erkunden, streben wir danach, hochwertige Denkverhaltensweisen aus dem Modell zu extrahieren. Allerdings stellen wir fest, dass naives Skalieren häufig unter schlechter Lesbarkeit, Token-Redundanz und einem Mangel an adaptiver Denktiefe leidet. Um diesen Herausforderungen zu begegnen, präsentieren wir eine stabile und effiziente Trainingspipeline, die algorithmische und systemseitige Optimierungen wie geklemmtes Importance Sampling, Korrektur des Trainings-Inferenz-Verhältnisses und Gemischte-Präzisionskontrolle umfasst. Unsere Experimente liefern drei zentrale Erkenntnisse, die die „bittere Lektion" des Skalierens bestätigen: (1) Die Skalierung auf 1 Billion Parameter verbessert die Stichprobeneffizienz und Leistungsobergrenzen signifikant; (2) Der Trainingsprozess durchläuft sequenziell eine anfängliche Entdeckungsphase, gefolgt von einer Schärfungsphase; und (3) Das Modell entwickelt spontan fortgeschrittene kognitive Verhaltensweisen, darunter Anthropomorphismus, strukturierte Formatierung, Selbstverifikation, paralleles Denken und Kontextangst, wodurch handgefertigte Heuristiken überflüssig werden. Bewertet auf sieben mathematischen Benchmarks erzielt Ring-2.5-1T-Zero konkurrenzfähige Leistungen. Darüber hinaus schlagen wir zur Bewertung der CoT-Qualität über die reine Korrektheit der endgültigen Antwort hinaus ein strukturiertes Bewertungsrahmenwerk in drei Dimensionen vor: Verständlichkeit, Reproduzierbarkeit und Effizienz, wobei unser Modell klare Vorteile bei der Erzeugung strukturierter und prägnanter Denkspuren aufweist. Durch das Teilen unserer beobachteten emergenten Phänomene hoffen wir, der Forschungsgemeinschaft tiefere Einblicke in Skalierungsverhalten, insbesondere im Bereich von einer Billion Parametern, zu bieten.
English
Reinforcement learning with verifiable rewards without human-annotated data, often referred to as zero RL, has emerged as a powerful paradigm for eliciting chain-of-thought reasoning. However, due to computational constraints, existing studies are largely restricted to small models, leaving the training dynamics and emergent capabilities at a large scale unexplored. To meaningfully explore this frontier, we aim to elicit high-quality reasoning behaviors from the model. However, we find that naive scaling often suffers from poor readability, token redundancy, and a lack of adaptive reasoning depth. To address these challenges, we present a stable and efficient training pipeline, incorporating algorithmic and system optimizations such as clipped importance sampling, training-inference ratio correction, and mixed-precision control. Our experiments offer three key findings that validate the "bitter lesson" of scaling: (1) scaling to 1T parameters significantly enhances sample efficiency and performance ceilings; (2) the training process progresses sequentially through an initial discovery phase followed by a sharpening phase; and (3) the model spontaneously develops advanced cognitive behaviors, including anthropomorphism, structured formatting, self-verification, parallel reasoning, and context anxiety, rendering hand-crafted heuristics redundant. Evaluated on seven mathematical benchmarks, Ring-2.5-1T-Zero achieves competitive performance. Additionally, to assess CoT quality beyond final-answer correctness, we propose a structured evaluation framework across three dimensions: comprehensibility, reproducibility, and efficiency, where our model demonstrates clear advantages in producing structured and concise reasoning traces. By sharing our observed emergent phenomena, we hope to provide the community with deeper insights into scaling behaviors, particularly at the 1-trillion scale.