Búsqueda más allá de lo enseñable: evolucionando la frontera del conocimiento en la generación visual agentiva
Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
July 9, 2026
Autores: Haozhe Wang, Weijia Feng, Jinpeng Yu, Che Liu, Ping Nie, Fangzhen Lin, Jiaming Liu, Ruihua Huang, Jimmy Lin, Wenhu Chen, Cong Wei
cs.AI
Resumen
Los generadores visuales destacan en el renderizado, pero inventan con seguridad lo que no conocen. Las solicitudes de los usuarios son ilimitadas, evolucionan y poseen una cola profundamente extensa: nuevos personajes, entidades de moda, eventos posteriores a la fecha de corte y mucho más. Este cuello de botella en el conocimiento del mundo es estructural: los generadores se entrenan con corpus fijos, pero el mundo visual es abierto. Construimos SearchGen-20K y SearchGen-Bench, con 20,839 instrucciones que abarcan doce categorías de fallos y veintidós dominios, junto con un Corpus de Búsqueda Multimodal SearchGen-1M preejecutado para respaldar una investigación reproducible y fuera de línea. En SearchGen-Bench, los generadores abiertos de vanguardia obtienen solo entre 21 y 28 sobre 100, un colapso de 40 puntos invisible para los puntos de referencia existentes. El remedio natural es emplear herramientas de búsqueda, habilitando la generación visual agente. Sin embargo, descubrimos que la búsqueda ingenua falla: recupera indiscriminadamente, inyectando ruido en las instrucciones que el generador ya maneja. Rastreamos la causa raíz hasta una frontera de conocimiento específica del generador y en evolución: la división entre lo que un generador puede internalizar mediante el entrenamiento y lo que debe permanecer en el contexto externo. Aunque esta frontera es difícil de especificar de antemano, mostramos que es descubrible a través de un marco de co-entrenamiento de "enseñar y luego buscar". Incluso una versión mínima de esta receta de co-entrenamiento produce una mejora monótona, sentando las bases para una automejora recursiva en la generación visual que pueda satisfacer solicitudes fundamentadas en el conocimiento del mundo. Publicamos el conjunto de datos completo, el corpus de co-entrenamiento y el corpus de búsqueda como un arnés reproducible para la generación visual aumentada con herramientas y fundamentada en el conocimiento del mundo.
English
Visual generators excel at rendering, but they confidently fabricate what they do not know. User requests are unbounded, evolving, and deeply long-tailed: new characters, trending entities, post-cutoff events, and more. This world-knowledge bottleneck is structural: generators are trained on fixed corpora, but the visual world is open-ended. We construct SearchGen-20K and SearchGen-Bench, with 20,839 prompts spanning twelve failure categories and twenty-two domains, paired with a pre-executed multimodal SearchGen-Corpus-1M to support offline, reproducible research. On SearchGen-Bench, frontier open generators score only 21 to 28 out of 100, a 40-point collapse invisible to existing benchmarks. The natural remedy is to employ search tools, enabling agentic visual generation. However, we find that naive search fails: it retrieves indiscriminately, injecting noise into prompts the generator already handles. We trace the root cause to a generator-specific, evolving knowledge boundary: the divide between what a generator can internalize through training and what must remain in external context. Although this boundary is hard to specify in advance, we show that it is discoverable through a teach-then-search co-training framework. Even a minimal version of this co-training recipe produces monotonic improvement, laying the foundation for recursive self-improvement in visual generation that can meet world-knowledge-grounded requests. We release the full dataset, co-training corpus, and search corpus as a replayable harness for tool-augmented, world-knowledge-grounded visual generation.