ChatPaper.aiChatPaper

A RL Pode Ensinar Raciocínio de Longo Prazo a LLMs? A Expressividade É a Chave

Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key

May 7, 2026
Autores: Tianle Wang, Zhaoyang Wang, Guangchen Lan, Xinpeng Wei, Sipeng Zhang, Guanwen Qiu, Abulhair Saparov
cs.AI

Resumo

O aprendizado por reforço (RL) tem sido aplicado para melhorar o raciocínio de grandes modelos de linguagem (LLMs), mas o estudo sistemático de como o treinamento escala com a dificuldade da tarefa tem sido dificultado pela falta de ambientes controlados e escaláveis. Apresentamos o ScaleLogic, uma estrutura sintética de raciocínio lógico que oferece controle independente sobre dois eixos de dificuldade: a profundidade do planejamento da prova necessário (ou seja, o horizonte) e a expressividade da lógica subjacente. Nossa estrutura proposta suporta uma ampla gama de lógicas: desde uma lógica simples de apenas implicação ("se-então") até raciocínio de primeira ordem mais expressivo com conjunção ("e"), disjunção ("ou"), negação ("não") e quantificação universal ("para todo"). Usando esta estrutura, mostramos que o custo computacional de treinamento por RL (T) segue uma lei de potência em relação à profundidade de raciocínio D (T ∝ D^γ, R² > 0,99), e que o expoente de escala γ aumenta monotonicamente com a expressividade lógica, de 1,04 para 2,60. Em benchmarks de matemática e raciocínio geral subsequentes, configurações de treinamento mais expressivas produzem tanto ganhos de desempenho maiores (até +10,66 pontos) quanto uma transferência mais eficiente em termos computacionais em comparação com configurações menos expressivas, demonstrando que *o conteúdo* no qual um modelo é treinado, e não apenas *a quantidade* de treinamento, molda a transferência para tarefas subsequentes. Mostramos ainda que a relação de lei de potência se mantém em múltiplos métodos de RL, e que o treinamento baseado em currículo melhora substancialmente a eficiência de escalonamento.
English
Reinforcement learning (RL) has been applied to improve large language model (LLM) reasoning, yet the systematic study of how training scales with task difficulty has been hampered by the lack of controlled, scalable environments. We introduce ScaleLogic, a synthetic logical reasoning framework that offers independent control over two axes of difficulty: the depth of the required proof planning (i.e., the horizon) and the expressiveness of the underlying logic. Our proposed framework supports a wide range of logics: from simple implication-only logic ("if-then") towards more expressive first-order reasoning with conjunction ("and"), disjunction ("or"), negation ("not"), and universal quantification ("for all"). Using this framework, we show that the RL training compute T follows a power law with respect to reasoning depth D (T propto D^γ, R^{2} > 0.99), and that the scaling exponent γ increases monotonically with logical expressiveness, from 1.04 to 2.60. On downstream mathematics and general reasoning benchmarks, more expressive training settings yield both larger performance gains (up to +10.66 points) and more compute-efficient transfer compared to less expressive settings, demonstrating that what a model is trained on, not just how much it is trained, shapes downstream transfer. We further show that the power-law relationship holds across multiple RL methods, and curriculum-based training substantially improves scaling efficiency.