ChatPaper.aiChatPaper

O Nonsense Ajuda: A Perturbação do Espaço de Prompts Amplia a Exploração do Raciocínio

Nonsense Helps: Prompt Space Perturbation Broadens Reasoning Exploration

May 7, 2026
Autores: Langlin Huang, Chengsong Huang, Jinyuan Li, Donghong Cai, Yuyi Yang, Jiaxin Huang
cs.AI

Resumo

O aprendizado por reforço com recompensas verificáveis, particularmente a Otimização de Política Relativa de Grupo (GRPO), avançou significativamente as capacidades de raciocínio dos Grandes Modelos de Linguagem (LLMs). No entanto, em tarefas complexas, a GRPO frequentemente sofre do "problema de vantagem zero": quando todas as rollouts amostradas para uma consulta falham, a vantagem relativa colapsa para zero. Consequentemente, o modelo perde sinais de treinamento eficazes para essas questões, desperdiçando os dados de treinamento e o orçamento computacional. Embora simplesmente aumentar o orçamento de amostragem para essas questões seja um remédio comum, a política de amostragem estática restringe inerentemente a exploração do raciocínio, limitando a taxa de sucesso. Neste artigo, propomos a Perturbação Lorem para Exploração (LoPE), uma estrutura de treinamento simples, mas eficaz, para superar esse gargalo de exploração. Postulamos que perturbações no espaço do prompt irrelevantes para a tarefa podem deslocar a distribuição de saída do modelo o suficiente para desbloquear vias de raciocínio ortogonais para questões difíceis. Especificamente, a LoPE antepõe sequências montadas estocasticamente a partir do vocabulário Lorem Ipsum (um texto de placeholder pseudo-latino) aos prompts antes da reamostragem. Experimentos com modelos de 1,7B, 4B e 7B demonstram que a LoPE supera significativamente a reamostragem com os prompts originais. Uma análise mais aprofundada revela que outras sequências aleatórias baseadas em latim com baixa perplexidade também são perturbações eficazes. Nossos resultados estabelecem a LoPE como uma linha de base forte para ampliar a exploração no aprendizado por reforço de LLMs.
English
Reinforcement learning with verifiable rewards, particularly Group Relative Policy Optimization (GRPO), has significantly advanced the reasoning capabilities of Large Language Models (LLMs). However, in complex tasks, GRPO frequently suffers from the ``zero-advantage problem'': when all sampled rollouts for a query fail, the relative advantage collapses to zero. Consequently, the model loses effective training signals for these questions, wasting the training data and computational budget. While simply increasing the sampling budget for these questions is a common remedy, the static sampling policy inherently constrains reasoning exploration, limiting the success rate. In this paper, we propose Lorem Perturbation for Exploration (LoPE), a simple yet effective training framework to break this exploration bottleneck. We posit that task-irrelevant prompt-space perturbations can shift the model's output distribution enough to unlock orthogonal reasoning pathways for hard questions. Specifically, LoPE prepends sequences stochastically assembled from Lorem Ipsum vocabulary (a pseudo-Latin placeholder text) to the prompts before resampling. Experiments across 1.7B, 4B, and 7B models demonstrate that LoPE significantly outperforms resampling with the original prompts. Further analysis reveals that other Latin-based random sequences with low perplexity are also effective perturbations. Our results establish LoPE as a strong baseline for broadening exploration in LLM reinforcement learning.