G-Zero: Zelfspel voor Open-Eindige Generatie vanuit Nul Data
G-Zero: Self-Play for Open-Ended Generation from Zero Data
May 11, 2026
Auteurs: Chengsong Huang, Haolin Liu, Tong Zheng, Runpeng Dai, Langlin Huang, Jinyuan Li, Zongxia Li, Zhepei Wei, Yu Meng, Jiaxin Huang
cs.AI
Samenvatting
Zelf-evoluerende LLM's excelleren in verifieerbare domeinen, maar hebben moeite met open-eindtaken, waar afhankelijkheid van proxy-LLM-beoordelaars capaciteitsknelpunten en reward hacking introduceert. Om dit te overwinnen, introduceren we G-Zero, een verifier-vrij co-evolutionair raamwerk voor autonome zelfverbetering. Onze kerninnovatie is Hint-δ, een intrinsieke beloning die de voorspellende verschuiving kwantificeert tussen de onondersteunde respons van een Generatormodel en de respons geconditioneerd op een zelf gegenereerde hint. Met behulp van dit signaal wordt een Proposermodel getraind via GRPO om continu de blinde vlekken van de Generator te targeten door uitdagende queries en informatieve hints te synthetiseren. De Generator wordt gelijktijdig geoptimaliseerd via DPO om deze hint-geleide verbeteringen te internaliseren. Theoretisch bewijzen we een beste-iteratie suboptimaliteitsgarantie voor een geïdealiseerde standaard-DPO-versie van G-Zero, op voorwaarde dat de Proposer voldoende exploratiedekking induceert en de datafiltering de ruis in pseudo-label scores laag houdt. Door supervisie volledig af te leiden uit interne distributionele dynamiek, omzeilt G-Zero de capaciteitsplafonds van externe beoordelaars, wat een schaalbaar, robuust pad biedt voor continue LLM-zelfevolutie in niet-verifieerbare domeinen.
English
Self-evolving LLMs excel in verifiable domains but struggle in open-ended tasks, where reliance on proxy LLM judges introduces capability bottlenecks and reward hacking. To overcome this, we introduce G-Zero, a verifier-free, co-evolutionary framework for autonomous self-improvement. Our core innovation is Hint-δ, an intrinsic reward that quantifies the predictive shift between a Generator model's unassisted response and its response conditioned on a self-generated hint. Using this signal, a Proposer model is trained via GRPO to continuously target the Generator's blind spots by synthesizing challenging queries and informative hints. The Generator is concurrently optimized via DPO to internalize these hint-guided improvements. Theoretically, we prove a best-iterate suboptimality guarantee for an idealized standard-DPO version of G-Zero, provided that the Proposer induces sufficient exploration coverage and the data filteration keeps pseudo-label score noise low. By deriving supervision entirely from internal distributional dynamics, G-Zero bypasses the capability ceilings of external judges, providing a scalable, robust pathway for continuous LLM self-evolution across unverifiable domains.