Suche jenseits des Lehrbaren: Evolution der Wissensgrenze in der agentischen visuellen Generierung
Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
July 9, 2026
Autoren: Haozhe Wang, Weijia Feng, Jinpeng Yu, Che Liu, Ping Nie, Fangzhen Lin, Jiaming Liu, Ruihua Huang, Jimmy Lin, Wenhu Chen, Cong Wei
cs.AI
Zusammenfassung
Visuelle Generatoren zeichnen sich durch ihr Rendering aus, aber sie erfinden selbstbewusst, was sie nicht wissen. Die Anfragen der Nutzer sind unbegrenzt, entwickeln sich weiter und weisen eine starke Long-Tail-Charakteristik auf: neue Figuren, trendige Entitäten, Ereignisse nach dem Stichtag und vieles mehr. Dieser Weltwissens-Engpass ist strukturell bedingt: Generatoren werden auf festen Textkorpora trainiert, aber die visuelle Welt ist offen. Wir stellen SearchGen-20K und SearchGen-Bench mit 20.839 Eingabeaufforderungen (Prompts) vor, die zwölf Fehlerkategorien und zweiundzwanzig Domänen abdecken, gepaart mit einem vorab ausgeführten multimodalen SearchGen-Corpus-1M zur Unterstützung offline durchführbarer, reproduzierbarer Forschung. Auf SearchGen-Bench erzielen führende offene Generatoren lediglich 21 bis 28 von 100 Punkten – ein 40-Punkte-Einbruch, der bei bestehenden Benchmarks unsichtbar bleibt. Die naheliegende Abhilfe ist der Einsatz von Suchwerkzeugen, die eine agentische visuelle Generierung ermöglichen. Wir stellen jedoch fest, dass naive Suche scheitert: Sie ruft wahllos ab, injiziert Rauschen in Eingabeaufforderungen, die der Generator bereits beherrscht. Wir führen die Ursache auf eine generatorspezifische, sich entwickelnde Wissensgrenze zurück: die Grenze zwischen dem, was ein Generator durch Training verinnerlichen kann, und dem, was im externen Kontext verbleiben muss. Obwohl diese Grenze im Voraus schwer zu spezifizieren ist, zeigen wir, dass sie durch ein Teach-then-Search-Co-Training-Framework entdeckt werden kann. Selbst eine minimale Version dieser Co-Training-Strategie erzeugt eine monotone Verbesserung und legt damit das Fundament für eine rekursive Selbstverbesserung in der visuellen Generierung, die weltwissensbasierte Anfragen erfüllen kann. Wir veröffentlichen den vollständigen Datensatz, das Co-Training-Korpus und das Suchkorpus als wiederholbares Testgerüst für werkzeugunterstützte, weltwissensbasierte visuelle Generierung.
English
Visual generators excel at rendering, but they confidently fabricate what they do not know. User requests are unbounded, evolving, and deeply long-tailed: new characters, trending entities, post-cutoff events, and more. This world-knowledge bottleneck is structural: generators are trained on fixed corpora, but the visual world is open-ended. We construct SearchGen-20K and SearchGen-Bench, with 20,839 prompts spanning twelve failure categories and twenty-two domains, paired with a pre-executed multimodal SearchGen-Corpus-1M to support offline, reproducible research. On SearchGen-Bench, frontier open generators score only 21 to 28 out of 100, a 40-point collapse invisible to existing benchmarks. The natural remedy is to employ search tools, enabling agentic visual generation. However, we find that naive search fails: it retrieves indiscriminately, injecting noise into prompts the generator already handles. We trace the root cause to a generator-specific, evolving knowledge boundary: the divide between what a generator can internalize through training and what must remain in external context. Although this boundary is hard to specify in advance, we show that it is discoverable through a teach-then-search co-training framework. Even a minimal version of this co-training recipe produces monotonic improvement, laying the foundation for recursive self-improvement in visual generation that can meet world-knowledge-grounded requests. We release the full dataset, co-training corpus, and search corpus as a replayable harness for tool-augmented, world-knowledge-grounded visual generation.