ChatPaper.aiChatPaper

CORE: Reflexão Contrastiva Permite Melhorias Rápidas no Raciocínio

CORE: Contrastive Reflection Enables Rapid Improvements in Reasoning

May 27, 2026
Autores: Linas Nasvytis, Simon Jerome Han, Ben Prystawski, Satchel Grant, Noah D. Goodman, Judith E. Fan
cs.AI

Resumo

Modelos de linguagem podem usar recompensas verificáveis para melhorar em uma ampla variedade de tarefas de raciocínio. No entanto, tanto abordagens paramétricas (ex.: RLVR) quanto não paramétricas (ex.: otimização de prompts) para isso geralmente exigem centenas de amostras de treinamento e milhares de execuções do modelo, tornando-as caras no melhor caso e intratáveis no pior. Para enfrentar esse desafio, apresentamos o Contrastive Reflection (CORE), um algoritmo de aprendizado não paramétrico que compara traços de raciocínio passados para gerar insights: descrições curtas em linguagem natural de estratégias e restrições de raciocínio que capturam diferenças entre tentativas bem-sucedidas e mal-sucedidas de problemas. Em quatro tarefas de raciocínio, demonstramos que o CORE possibilita uma melhoria mais rápida do que métodos paramétricos (GRPO) e não paramétricos (GEPA, RAG episódico e MemRL), enquanto utiliza menos execuções. Sob orçamentos fixos de execução com apenas cinco amostras de treinamento, mostramos então que o CORE também alcança ganhos de desempenho comparáveis ou superiores a cada linha de base. Por fim, destacamos como o CORE é também substancialmente mais eficiente em termos de contexto do que as linhas de base não paramétricas, exigindo menos tokens de prompt enquanto armazena o conhecimento aprendido como insights compactos e interpretáveis em linguagem natural. Portanto, nossos resultados sugerem que destilar contrastes entre traços de raciocínio bem-sucedidos e mal-sucedidos em insights abstratos e úteis pode fornecer um caminho mais eficiente e interpretável para o autoaperfeiçoamento do modelo do que atualizações de pesos, otimização de prompts ou reutilização direta de traços de raciocínio armazenados.
English
Language models can use verifiable rewards to improve at a wide variety of reasoning tasks. However, both parametric (e.g. RLVR) and non-parametric (e.g. prompt optimization) approaches to doing so typically require hundreds of training samples and thousands of model rollouts, making them expensive in the best case and intractable in the worst. To address this challenge, we introduce Contrastive Reflection (CORE), a non-parametric learning algorithm that compares past reasoning traces to generate insights: short natural-language descriptions of reasoning strategies and constraints that capture differences between successful and unsuccessful problem attempts. Across four reasoning tasks, we demonstrate that CORE enables more rapid improvement than both parametric (GRPO) and non-parametric (GEPA, episodic RAG, and MemRL) methods, while using fewer rollouts. Under fixed rollout budgets with as few as five training samples, we then show that CORE also achieves comparable or greater performance gains than each baseline. Finally, we highlight how CORE is also substantially more context-efficient than non-parametric baselines, requiring fewer prompt tokens while storing learned knowledge as compact, interpretable natural-language insights. Our results therefore suggest that distilling contrasts between successful and unsuccessful reasoning traces into abstract and useful insights can provide a more efficient and interpretable route to model self-improvement than weight updates, prompt optimization, or direct reuse of stored reasoning traces.