ChatPaper.aiChatPaper

Ring-Zero: Escalonamento do Zero RL para um Trilhão de Parâmetros para Raciocínio Emergente

Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

July 14, 2026
Autores: Xinyu Tang, Gangqiang Cao, Yurou Liu, Yuliang Zhan, Xiaochong Lan, Yifan Li, Yuchen Yan, Han Peng, Zican Dong, Zhenduo Zhang, Tianshu Wang, Xinyu Kong, Zujie Wen, Wayne Xin Zhao, Zhiqiang Zhang, Jun Zhou
cs.AI

Resumo

Aprendizado por reforço com recompensas verificáveis sem dados anotados por humanos, frequentemente referido como RL zero, emergiu como um paradigma poderoso para eliciar raciocínio em cadeia de pensamento. No entanto, devido a restrições computacionais, os estudos existentes são em grande parte restritos a modelos pequenos, deixando inexploradas as dinâmicas de treinamento e as capacidades emergentes em grande escala. Para explorar significativamente essa fronteira, nosso objetivo é eliciar comportamentos de raciocínio de alta qualidade a partir do modelo. Contudo, descobrimos que a escalabilidade ingênua frequentemente sofre de baixa legibilidade, redundância de tokens e falta de profundidade adaptativa de raciocínio. Para enfrentar esses desafios, apresentamos um pipeline de treinamento estável e eficiente, incorporando otimizações algorítmicas e de sistema, como amostragem por importância truncada, correção da razão treinamento-inferência e controle de precisão mista. Nossos experimentos oferecem três descobertas principais que validam a "lição amarga" da escalabilidade: (1) escalar para 1 trilhão de parâmetros melhora significativamente a eficiência amostral e os tetos de desempenho; (2) o processo de treinamento progride sequencialmente através de uma fase inicial de descoberta seguida por uma fase de refinamento; e (3) o modelo desenvolve espontaneamente comportamentos cognitivos avançados, incluindo antropomorfismo, formatação estruturada, autoverificação, raciocínio paralelo e ansiedade de contexto, tornando heurísticas artesanais redundantes. Avaliado em sete benchmarks matemáticos, o Ring-2.5-1T-Zero alcança desempenho competitivo. Além disso, para avaliar a qualidade da cadeia de pensamento além da correção da resposta final, propomos um framework de avaliação estruturado em três dimensões: compreensibilidade, reprodutibilidade e eficiência, onde nosso modelo demonstra vantagens claras na produção de traços de raciocínio estruturados e concisos. Ao compartilhar nossos fenômenos emergentes observados, esperamos fornecer à comunidade insights mais profundos sobre comportamentos de escalabilidade, particularmente na escala de 1 trilhão.
English
Reinforcement learning with verifiable rewards without human-annotated data, often referred to as zero RL, has emerged as a powerful paradigm for eliciting chain-of-thought reasoning. However, due to computational constraints, existing studies are largely restricted to small models, leaving the training dynamics and emergent capabilities at a large scale unexplored. To meaningfully explore this frontier, we aim to elicit high-quality reasoning behaviors from the model. However, we find that naive scaling often suffers from poor readability, token redundancy, and a lack of adaptive reasoning depth. To address these challenges, we present a stable and efficient training pipeline, incorporating algorithmic and system optimizations such as clipped importance sampling, training-inference ratio correction, and mixed-precision control. Our experiments offer three key findings that validate the "bitter lesson" of scaling: (1) scaling to 1T parameters significantly enhances sample efficiency and performance ceilings; (2) the training process progresses sequentially through an initial discovery phase followed by a sharpening phase; and (3) the model spontaneously develops advanced cognitive behaviors, including anthropomorphism, structured formatting, self-verification, parallel reasoning, and context anxiety, rendering hand-crafted heuristics redundant. Evaluated on seven mathematical benchmarks, Ring-2.5-1T-Zero achieves competitive performance. Additionally, to assess CoT quality beyond final-answer correctness, we propose a structured evaluation framework across three dimensions: comprehensibility, reproducibility, and efficiency, where our model demonstrates clear advantages in producing structured and concise reasoning traces. By sharing our observed emergent phenomena, we hope to provide the community with deeper insights into scaling behaviors, particularly at the 1-trillion scale.