ChatPaper.aiChatPaper

G-Zero : Auto-jeu pour la génération ouverte à partir de zéro donnée

G-Zero: Self-Play for Open-Ended Generation from Zero Data

May 11, 2026
Auteurs: Chengsong Huang, Haolin Liu, Tong Zheng, Runpeng Dai, Langlin Huang, Jinyuan Li, Zongxia Li, Zhepei Wei, Yu Meng, Jiaxin Huang
cs.AI

Résumé

Les LLM auto-évolutifs excellent dans les domaines vérifiables mais peinent dans les tâches ouvertes, où le recours à des juges LLM proxy introduit des goulots d'étranglement capacitaires et du piratage de récompense. Pour surmonter ce problème, nous présentons G-Zero, un cadre co-évolutif sans vérificateur pour l'auto-amélioration autonome. Notre innovation centrale est Hint-δ, une récompense intrinsèque qui quantifie le décalage prédictif entre la réponse non assistée d'un modèle générateur et sa réponse conditionnée par un indice auto-généré. En utilisant ce signal, un modèle proposeur est entraîné via GRPO à cibler en continu les angles morts du générateur en synthétisant des requêtes difficiles et des indices informatifs. Le générateur est simultanément optimisé via DPO pour internaliser ces améliorations guidées par les indices. Théoriquement, nous prouvons une garantie de sous-optimalité en meilleure itération pour une version idéalisée de G-Zero basée sur DPO standard, à condition que le proposeur induise une couverture d'exploration suffisante et que le filtrage des données maintienne un faible bruit dans les scores des pseudo-étiquettes. En dérivant la supervision entièrement à partir de la dynamique distributionnelle interne, G-Zero contourne les plafonds de capacité des juges externes, offrant une voie scalable et robuste pour l'auto-évolution continue des LLM dans des domaines non vérifiables.
English
Self-evolving LLMs excel in verifiable domains but struggle in open-ended tasks, where reliance on proxy LLM judges introduces capability bottlenecks and reward hacking. To overcome this, we introduce G-Zero, a verifier-free, co-evolutionary framework for autonomous self-improvement. Our core innovation is Hint-δ, an intrinsic reward that quantifies the predictive shift between a Generator model's unassisted response and its response conditioned on a self-generated hint. Using this signal, a Proposer model is trained via GRPO to continuously target the Generator's blind spots by synthesizing challenging queries and informative hints. The Generator is concurrently optimized via DPO to internalize these hint-guided improvements. Theoretically, we prove a best-iterate suboptimality guarantee for an idealized standard-DPO version of G-Zero, provided that the Proposer induces sufficient exploration coverage and the data filteration keeps pseudo-label score noise low. By deriving supervision entirely from internal distributional dynamics, G-Zero bypasses the capability ceilings of external judges, providing a scalable, robust pathway for continuous LLM self-evolution across unverifiable domains.