Ring-Zero: Escalando Zero RL a un Billón de Parámetros para Razonamiento Emergente

Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

July 14, 2026
Autores: Xinyu Tang, Gangqiang Cao, Yurou Liu, Yuliang Zhan, Xiaochong Lan, Yifan Li, Yuchen Yan, Han Peng, Zican Dong, Zhenduo Zhang, Tianshu Wang, Xinyu Kong, Zujie Wen, Wayne Xin Zhao, Zhiqiang Zhang, Jun Zhou
cs.AI

Resumen

El aprendizaje por refuerzo con recompensas verificables sin datos anotados por humanos, a menudo denominado RL cero, ha surgido como un paradigma poderoso para generar razonamiento de cadena de pensamiento. Sin embargo, debido a limitaciones computacionales, los estudios existentes se restringen en gran medida a modelos pequeños, dejando sin explorar las dinámicas de entrenamiento y las capacidades emergentes a gran escala. Para explorar significativamente esta frontera, nuestro objetivo es generar comportamientos de razonamiento de alta calidad a partir del modelo. No obstante, encontramos que el escalado ingenuo a menudo sufre de poca legibilidad, redundancia de tokens y falta de profundidad de razonamiento adaptativa. Para abordar estos desafíos, presentamos un pipeline de entrenamiento estable y eficiente, que incorpora optimizaciones algorítmicas y de sistema, como muestreo por importancia recortado, corrección de la relación entrenamiento-inferencia y control de precisión mixta. Nuestros experimentos ofrecen tres hallazgos clave que validan la "lección amarga" del escalado: (1) escalar a 1 billón de parámetros mejora significativamente la eficiencia de muestreo y los límites de rendimiento; (2) el proceso de entrenamiento progresa secuencialmente a través de una fase de descubrimiento inicial seguida de una fase de refinamiento; y (3) el modelo desarrolla espontáneamente comportamientos cognitivos avanzados, incluyendo antropomorfismo, formato estructurado, autoverificación, razonamiento paralelo y ansiedad contextual, volviendo redundantes las heurísticas artesanales. Evaluado en siete referencias matemáticas, Ring-2.5-1T-Zero logra un rendimiento competitivo. Además, para evaluar la calidad del CoT más allá de la corrección de la respuesta final, proponemos un marco de evaluación estructurado en tres dimensiones: comprensibilidad, reproducibilidad y eficiencia, donde nuestro modelo demuestra claras ventajas en la producción de trazas de razonamiento estructuradas y concisas. Al compartir los fenómenos emergentes observados, esperamos proporcionar a la comunidad una comprensión más profunda de los comportamientos de escalado, particularmente a la escala de 1 billón de parámetros.
English
Reinforcement learning with verifiable rewards without human-annotated data, often referred to as zero RL, has emerged as a powerful paradigm for eliciting chain-of-thought reasoning. However, due to computational constraints, existing studies are largely restricted to small models, leaving the training dynamics and emergent capabilities at a large scale unexplored. To meaningfully explore this frontier, we aim to elicit high-quality reasoning behaviors from the model. However, we find that naive scaling often suffers from poor readability, token redundancy, and a lack of adaptive reasoning depth. To address these challenges, we present a stable and efficient training pipeline, incorporating algorithmic and system optimizations such as clipped importance sampling, training-inference ratio correction, and mixed-precision control. Our experiments offer three key findings that validate the "bitter lesson" of scaling: (1) scaling to 1T parameters significantly enhances sample efficiency and performance ceilings; (2) the training process progresses sequentially through an initial discovery phase followed by a sharpening phase; and (3) the model spontaneously develops advanced cognitive behaviors, including anthropomorphism, structured formatting, self-verification, parallel reasoning, and context anxiety, rendering hand-crafted heuristics redundant. Evaluated on seven mathematical benchmarks, Ring-2.5-1T-Zero achieves competitive performance. Additionally, to assess CoT quality beyond final-answer correctness, we propose a structured evaluation framework across three dimensions: comprehensibility, reproducibility, and efficiency, where our model demonstrates clear advantages in producing structured and concise reasoning traces. By sharing our observed emergent phenomena, we hope to provide the community with deeper insights into scaling behaviors, particularly at the 1-trillion scale.
PDF792July 17, 2026