Ring-Zero : Mise à l'échelle de Zero RL à un trillion de paramètres pour un raisonnement émergent
Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
July 14, 2026
Auteurs: Xinyu Tang, Gangqiang Cao, Yurou Liu, Yuliang Zhan, Xiaochong Lan, Yifan Li, Yuchen Yan, Han Peng, Zican Dong, Zhenduo Zhang, Tianshu Wang, Xinyu Kong, Zujie Wen, Wayne Xin Zhao, Zhiqiang Zhang, Jun Zhou
cs.AI
Résumé
L'apprentissage par renforcement avec récompenses vérifiables sans données annotées par des humains, souvent appelé zéro RL, est devenu un paradigme puissant pour susciter un raisonnement en chaîne de pensée. Cependant, en raison de contraintes de calcul, les études existantes sont largement limitées aux petits modèles, laissant inexplorées les dynamiques d'entraînement et les capacités émergentes à grande échelle. Pour explorer cette frontière de manière significative, nous visons à susciter des comportements de raisonnement de haute qualité de la part du modèle. Cependant, nous constatons que la mise à l'échelle naïve souffre souvent d'une faible lisibilité, d'une redondance de tokens et d'un manque de profondeur de raisonnement adaptative. Pour relever ces défis, nous présentons un pipeline d'entraînement stable et efficace, intégrant des optimisations algorithmiques et système telles que l'échantillonnage d'importance avec écrêtage, la correction du ratio entraînement-inférence et le contrôle de précision mixte. Nos expériences offrent trois résultats clés qui valident la « leçon amère » du passage à l'échelle : (1) le passage à 1 000 milliards de paramètres améliore considérablement l'efficacité d'échantillonnage et les plafonds de performance ; (2) le processus d'entraînement progresse séquentiellement à travers une phase de découverte initiale suivie d'une phase d'affinage ; et (3) le modèle développe spontanément des comportements cognitifs avancés, notamment l'anthropomorphisme, la mise en forme structurée, l'auto-vérification, le raisonnement parallèle et l'anxiété contextuelle, rendant les heuristiques artisanales redondantes. Évalué sur sept références mathématiques, Ring-2.5-1T-Zero atteint des performances compétitives. De plus, pour évaluer la qualité de la CoT au-delà de la justesse de la réponse finale, nous proposons un cadre d'évaluation structuré à travers trois dimensions : la compréhensibilité, la reproductibilité et l'efficacité, où notre modèle démontre des avantages clairs dans la production de traces de raisonnement structurées et concises. En partageant nos phénomènes émergents observés, nous espérons fournir à la communauté des perspectives plus approfondies sur les comportements de passage à l'échelle, en particulier à l'échelle du trillion.
English
Reinforcement learning with verifiable rewards without human-annotated data, often referred to as zero RL, has emerged as a powerful paradigm for eliciting chain-of-thought reasoning. However, due to computational constraints, existing studies are largely restricted to small models, leaving the training dynamics and emergent capabilities at a large scale unexplored. To meaningfully explore this frontier, we aim to elicit high-quality reasoning behaviors from the model. However, we find that naive scaling often suffers from poor readability, token redundancy, and a lack of adaptive reasoning depth. To address these challenges, we present a stable and efficient training pipeline, incorporating algorithmic and system optimizations such as clipped importance sampling, training-inference ratio correction, and mixed-precision control. Our experiments offer three key findings that validate the "bitter lesson" of scaling: (1) scaling to 1T parameters significantly enhances sample efficiency and performance ceilings; (2) the training process progresses sequentially through an initial discovery phase followed by a sharpening phase; and (3) the model spontaneously develops advanced cognitive behaviors, including anthropomorphism, structured formatting, self-verification, parallel reasoning, and context anxiety, rendering hand-crafted heuristics redundant. Evaluated on seven mathematical benchmarks, Ring-2.5-1T-Zero achieves competitive performance. Additionally, to assess CoT quality beyond final-answer correctness, we propose a structured evaluation framework across three dimensions: comprehensibility, reproducibility, and efficiency, where our model demonstrates clear advantages in producing structured and concise reasoning traces. By sharing our observed emergent phenomena, we hope to provide the community with deeper insights into scaling behaviors, particularly at the 1-trillion scale.