ChatPaper.aiChatPaper

Zoeken voorbij het aanleerbare: het evolueren van de kennisgrens in agentische visuele generatie

Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation

July 9, 2026
Auteurs: Haozhe Wang, Weijia Feng, Jinpeng Yu, Che Liu, Ping Nie, Fangzhen Lin, Jiaming Liu, Ruihua Huang, Jimmy Lin, Wenhu Chen, Cong Wei
cs.AI

Samenvatting

Visuele generatoren blinken uit in het weergeven van beelden, maar verzinnen vol vertrouwen wat ze niet weten. Gebruikersverzoeken zijn onbegrensd, evolueren voortdurend en vertonen een diepe lange staart: nieuwe personages, trending entiteiten, gebeurtenissen na de afsluitdatum van de trainingsdata, en meer. Deze kennisknelpunt over de wereld is structureel: generatoren worden getraind op vaste corpora, maar de visuele wereld is open-eindig. We construeren SearchGen-20K en SearchGen-Bench, met 20.839 prompts die twaalf faalcategorieën en tweeëntwintig domeinen bestrijken, gekoppeld aan een vooraf uitgevoerde multimodale SearchGen-Corpus-1M om offline, reproduceerbaar onderzoek te ondersteunen. Op SearchGen-Bench scoren toonaangevende open generatoren slechts 21 tot 28 van de 100 punten, een instorting van 40 punten die onzichtbaar blijft voor bestaande benchmarks. De natuurlijke remedie is het inzetten van zoekhulpmiddelen, wat leidt tot agentische visuele generatie. We ontdekken echter dat naïef zoeken faalt: het haalt zonder onderscheid informatie op en introduceert ruis in prompts die de generator al aankan. We traceren de oorzaak naar een generatorspecifieke, evoluerende kennisdrempel: de scheiding tussen wat een generator kan internaliseren via training en wat extern in de context moet blijven. Hoewel deze drempel vooraf moeilijk te specificeren is, tonen we aan dat deze ontdekbaar is via een train-en-zoek co-training raamwerk. Zelfs een minimale versie van dit co-training recept levert monotone verbetering op, wat de basis legt voor recursieve zelfverbetering in visuele generatie die kan voldoen aan verzoeken die geworteld zijn in wereldkennis. We publiceren de volledige dataset, het co-training corpus en het zoekcorpus als een herbruikbare testopstelling voor gereedschapsversterkte, op wereldkennis gebaseerde visuele generatie.
English
Visual generators excel at rendering, but they confidently fabricate what they do not know. User requests are unbounded, evolving, and deeply long-tailed: new characters, trending entities, post-cutoff events, and more. This world-knowledge bottleneck is structural: generators are trained on fixed corpora, but the visual world is open-ended. We construct SearchGen-20K and SearchGen-Bench, with 20,839 prompts spanning twelve failure categories and twenty-two domains, paired with a pre-executed multimodal SearchGen-Corpus-1M to support offline, reproducible research. On SearchGen-Bench, frontier open generators score only 21 to 28 out of 100, a 40-point collapse invisible to existing benchmarks. The natural remedy is to employ search tools, enabling agentic visual generation. However, we find that naive search fails: it retrieves indiscriminately, injecting noise into prompts the generator already handles. We trace the root cause to a generator-specific, evolving knowledge boundary: the divide between what a generator can internalize through training and what must remain in external context. Although this boundary is hard to specify in advance, we show that it is discoverable through a teach-then-search co-training framework. Even a minimal version of this co-training recipe produces monotonic improvement, laying the foundation for recursive self-improvement in visual generation that can meet world-knowledge-grounded requests. We release the full dataset, co-training corpus, and search corpus as a replayable harness for tool-augmented, world-knowledge-grounded visual generation.