ChatPaper.aiChatPaper

Chercher au-delà de ce qui peut être enseigné : Faire évoluer la frontière des connaissances dans la génération visuelle agentique

Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation

July 9, 2026
Auteurs: Haozhe Wang, Weijia Feng, Jinpeng Yu, Che Liu, Ping Nie, Fangzhen Lin, Jiaming Liu, Ruihua Huang, Jimmy Lin, Wenhu Chen, Cong Wei
cs.AI

Résumé

Les générateurs visuels excellent dans le rendu, mais ils fabriquent avec assurance ce qu'ils ne connaissent pas. Les requêtes des utilisateurs sont illimitées, en constante évolution et profondément en queue de distribution longue : nouveaux personnages, entités tendances, événements postérieurs à la coupure, et bien plus encore. Ce goulot d'étranglement de la connaissance du monde est structurel : les générateurs sont entraînés sur des corpus fixes, alors que le monde visuel est ouvert. Nous construisons SearchGen-20K et SearchGen-Bench, avec 20 839 invites couvrant douze catégories d'échec et vingt-deux domaines, associés à un corpus multimodal pré-exécuté SearchGen-Corpus-1M pour soutenir une recherche reproductible hors ligne. Sur SearchGen-Bench, les générateurs ouverts de pointe n'obtiennent que 21 à 28 sur 100, un effondrement de 40 points invisible dans les références existantes. Le remède naturel consiste à utiliser des outils de recherche, permettant une génération visuelle agentique. Cependant, nous constatons qu'une recherche naïve échoue : elle récupère sans discernement, injectant du bruit dans les invites que le générateur traite déjà. Nous retraçons la cause racine à une frontière de connaissance spécifique au générateur et en évolution : la division entre ce qu'un générateur peut internaliser par l'entraînement et ce qui doit rester dans un contexte externe. Bien que cette frontière soit difficile à spécifier à l'avance, nous montrons qu'elle est découvrable via un cadre de co-apprentissage enseigner-puis-chercher. Même une version minimale de cette recette de co-apprentissage produit une amélioration monotone, posant les bases d'une auto-amélioration récursive dans la génération visuelle capable de répondre aux requêtes ancrées dans la connaissance du monde. Nous publions l'ensemble complet des données, le corpus de co-apprentissage et le corpus de recherche en tant que harnais rejouable pour la génération visuelle augmentée par outils et ancrée dans la connaissance du monde.
English
Visual generators excel at rendering, but they confidently fabricate what they do not know. User requests are unbounded, evolving, and deeply long-tailed: new characters, trending entities, post-cutoff events, and more. This world-knowledge bottleneck is structural: generators are trained on fixed corpora, but the visual world is open-ended. We construct SearchGen-20K and SearchGen-Bench, with 20,839 prompts spanning twelve failure categories and twenty-two domains, paired with a pre-executed multimodal SearchGen-Corpus-1M to support offline, reproducible research. On SearchGen-Bench, frontier open generators score only 21 to 28 out of 100, a 40-point collapse invisible to existing benchmarks. The natural remedy is to employ search tools, enabling agentic visual generation. However, we find that naive search fails: it retrieves indiscriminately, injecting noise into prompts the generator already handles. We trace the root cause to a generator-specific, evolving knowledge boundary: the divide between what a generator can internalize through training and what must remain in external context. Although this boundary is hard to specify in advance, we show that it is discoverable through a teach-then-search co-training framework. Even a minimal version of this co-training recipe produces monotonic improvement, laying the foundation for recursive self-improvement in visual generation that can meet world-knowledge-grounded requests. We release the full dataset, co-training corpus, and search corpus as a replayable harness for tool-augmented, world-knowledge-grounded visual generation.