Ring-Zero: масштабирование Zero RL до триллиона параметров для эмерджентного рассуждения
Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
July 14, 2026
Авторы: Xinyu Tang, Gangqiang Cao, Yurou Liu, Yuliang Zhan, Xiaochong Lan, Yifan Li, Yuchen Yan, Han Peng, Zican Dong, Zhenduo Zhang, Tianshu Wang, Xinyu Kong, Zujie Wen, Wayne Xin Zhao, Zhiqiang Zhang, Jun Zhou
cs.AI
Аннотация
Обучение с подкреплением на основе проверяемых наград без использования аннотированных человеком данных, часто называемое нулевым RL (zero RL), стало мощной парадигмой для извлечения цепочек рассуждений (chain-of-thought reasoning). Однако из-за вычислительных ограничений существующие исследования в основном ограничиваются небольшими моделями, оставляя динамику обучения и эмерджентные способности при масштабировании неизученными. Чтобы содержательно исследовать этот рубеж, мы стремимся получить от модели высококачественные паттерны рассуждений. Однако мы обнаруживаем, что наивное масштабирование часто страдает от плохой читаемости, избыточности токенов и отсутствия адаптивной глубины рассуждений. Для решения этих проблем мы представляем стабильный и эффективный конвейер обучения, включающий алгоритмические и системные оптимизации, такие как усеченная выборка по важности, коррекция соотношения обучения и инференса, а также управление смешанной точностью. Наши эксперименты дают три ключевых результата, подтверждающих «горький урок» масштабирования: (1) масштабирование до 1 триллиона параметров значительно повышает эффективность выборки и потолок производительности; (2) процесс обучения последовательно проходит через начальную фазу открытия, за которой следует фаза заточки; (3) модель спонтанно развивает продвинутые когнитивные поведения, включая антропоморфизм, структурированное форматирование, самопроверку, параллельное рассуждение и контекстную тревожность, делая созданные вручную эвристики избыточными. Оцененная на семи математических бенчмарках, модель Ring-2.5-1T-Zero достигает конкурентоспособной производительности. Кроме того, для оценки качества CoT за пределами правильности конечного ответа мы предлагаем структурированную схему оценки по трем измерениям: понятность, воспроизводимость и эффективность, где наша модель демонстрирует явные преимущества в создании структурированных и лаконичных трасс рассуждений. Делясь наблюдаемыми эмерджентными явлениями, мы надеемся предоставить сообществу более глубокое понимание поведения при масштабировании, особенно на уровне 1 триллиона параметров.
English
Reinforcement learning with verifiable rewards without human-annotated data, often referred to as zero RL, has emerged as a powerful paradigm for eliciting chain-of-thought reasoning. However, due to computational constraints, existing studies are largely restricted to small models, leaving the training dynamics and emergent capabilities at a large scale unexplored. To meaningfully explore this frontier, we aim to elicit high-quality reasoning behaviors from the model. However, we find that naive scaling often suffers from poor readability, token redundancy, and a lack of adaptive reasoning depth. To address these challenges, we present a stable and efficient training pipeline, incorporating algorithmic and system optimizations such as clipped importance sampling, training-inference ratio correction, and mixed-precision control. Our experiments offer three key findings that validate the "bitter lesson" of scaling: (1) scaling to 1T parameters significantly enhances sample efficiency and performance ceilings; (2) the training process progresses sequentially through an initial discovery phase followed by a sharpening phase; and (3) the model spontaneously develops advanced cognitive behaviors, including anthropomorphism, structured formatting, self-verification, parallel reasoning, and context anxiety, rendering hand-crafted heuristics redundant. Evaluated on seven mathematical benchmarks, Ring-2.5-1T-Zero achieves competitive performance. Additionally, to assess CoT quality beyond final-answer correctness, we propose a structured evaluation framework across three dimensions: comprehensibility, reproducibility, and efficiency, where our model demonstrates clear advantages in producing structured and concise reasoning traces. By sharing our observed emergent phenomena, we hope to provide the community with deeper insights into scaling behaviors, particularly at the 1-trillion scale.