G-Zero: Auto-Jogo para Geração Aberta a Partir de Dados Zero
G-Zero: Self-Play for Open-Ended Generation from Zero Data
May 11, 2026
Autores: Chengsong Huang, Haolin Liu, Tong Zheng, Runpeng Dai, Langlin Huang, Jinyuan Li, Zongxia Li, Zhepei Wei, Yu Meng, Jiaxin Huang
cs.AI
Resumo
LLMs autoevolutivas são excelentes em domínios verificáveis, mas enfrentam dificuldades em tarefas abertas, onde a dependência de juízes LLM substitutos introduz gargalos de capacidade e manipulação de recompensas. Para superar isso, apresentamos G-Zero, uma estrutura coevolutiva e livre de verificadores para autoaperfeiçoamento autônomo. Nossa inovação central é o Hint-δ, uma recompensa intrínseca que quantifica o desvio preditivo entre a resposta não assistida de um modelo Gerador e sua resposta condicionada a uma dica autogerada. Utilizando esse sinal, um modelo Propositor é treinado via GRPO para mirar continuamente nos pontos cegos do Gerador, sintetizando consultas desafiadoras e dicas informativas. O Gerador é simultaneamente otimizado via DPO para internalizar essas melhorias guiadas por dicas. Teoricamente, provamos uma garantia de subotimalidade de melhor iteração para uma versão idealizada do G-Zero baseada em DPO padrão, desde que o Propositor induza cobertura de exploração suficiente e que a filtragem de dados mantenha baixo o ruído das pontuações de pseudorrótulos. Ao derivar a supervisão inteiramente da dinâmica distribucional interna, o G-Zero contorna os tetos de capacidade de juízes externos, fornecendo um caminho escalável e robusto para autoevolução contínua de LLMs em domínios não verificáveis.
English
Self-evolving LLMs excel in verifiable domains but struggle in open-ended tasks, where reliance on proxy LLM judges introduces capability bottlenecks and reward hacking. To overcome this, we introduce G-Zero, a verifier-free, co-evolutionary framework for autonomous self-improvement. Our core innovation is Hint-δ, an intrinsic reward that quantifies the predictive shift between a Generator model's unassisted response and its response conditioned on a self-generated hint. Using this signal, a Proposer model is trained via GRPO to continuously target the Generator's blind spots by synthesizing challenging queries and informative hints. The Generator is concurrently optimized via DPO to internalize these hint-guided improvements. Theoretically, we prove a best-iterate suboptimality guarantee for an idealized standard-DPO version of G-Zero, provided that the Proposer induces sufficient exploration coverage and the data filteration keeps pseudo-label score noise low. By deriving supervision entirely from internal distributional dynamics, G-Zero bypasses the capability ceilings of external judges, providing a scalable, robust pathway for continuous LLM self-evolution across unverifiable domains.