ChatPaper.aiChatPaper

Поиск за пределами обучаемого: Развитие границы знаний в агентной визуальной генерации

Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation

July 9, 2026
Авторы: Haozhe Wang, Weijia Feng, Jinpeng Yu, Che Liu, Ping Nie, Fangzhen Lin, Jiaming Liu, Ruihua Huang, Jimmy Lin, Wenhu Chen, Cong Wei
cs.AI

Аннотация

Визуальные генераторы превосходно справляются с рендерингом, но уверенно выдумывают то, чего не знают. Запросы пользователей безграничны, постоянно развиваются и имеют глубоко длиннохвостое распределение: новые персонажи, трендовые сущности, события после даты отсечения и многое другое. Это узкое место в знании мира носит структурный характер: генераторы обучаются на фиксированных корпусах, в то время как визуальный мир открыт. Мы создали SearchGen-20K и SearchGen-Bench, содержащие 20 839 промптов, охватывающих двенадцать категорий ошибок и двадцать две предметные области, в паре с предварительно выполненным мультимодальным корпусом SearchGen-Corpus-1M для поддержки автономных воспроизводимых исследований. На SearchGen-Bench передовые открытые генераторы набирают всего от 21 до 28 баллов из 100 — падение на 40 баллов, незаметное для существующих бенчмарков. Естественным решением является использование инструментов поиска, что позволяет осуществлять агентную визуальную генерацию. Однако мы обнаружили, что наивный поиск не справляется: он извлекает данные без разбора, внося шум в запросы, которые генератор уже обрабатывает. Мы прослеживаем коренную причину до зависящей от генератора, эволюционирующей границы знаний — разделения между тем, что генератор может усвоить в процессе обучения, и тем, что должно оставаться во внешнем контексте. Хотя эту границу трудно задать заранее, мы показываем, что ее можно обнаружить с помощью фреймворка совместного обучения «обучи-затем-ищи». Даже минимальная версия этого рецепта совместного обучения дает монотонное улучшение, закладывая основу для рекурсивного самоулучшения в визуальной генерации, способной удовлетворять запросы, основанные на знании мира. Мы публикуем полный набор данных, корпус для совместного обучения и поисковый корпус в качестве воспроизводимого инструментария для дополненной инструментами визуальной генерации, основанной на знании мира.
English
Visual generators excel at rendering, but they confidently fabricate what they do not know. User requests are unbounded, evolving, and deeply long-tailed: new characters, trending entities, post-cutoff events, and more. This world-knowledge bottleneck is structural: generators are trained on fixed corpora, but the visual world is open-ended. We construct SearchGen-20K and SearchGen-Bench, with 20,839 prompts spanning twelve failure categories and twenty-two domains, paired with a pre-executed multimodal SearchGen-Corpus-1M to support offline, reproducible research. On SearchGen-Bench, frontier open generators score only 21 to 28 out of 100, a 40-point collapse invisible to existing benchmarks. The natural remedy is to employ search tools, enabling agentic visual generation. However, we find that naive search fails: it retrieves indiscriminately, injecting noise into prompts the generator already handles. We trace the root cause to a generator-specific, evolving knowledge boundary: the divide between what a generator can internalize through training and what must remain in external context. Although this boundary is hard to specify in advance, we show that it is discoverable through a teach-then-search co-training framework. Even a minimal version of this co-training recipe produces monotonic improvement, laying the foundation for recursive self-improvement in visual generation that can meet world-knowledge-grounded requests. We release the full dataset, co-training corpus, and search corpus as a replayable harness for tool-augmented, world-knowledge-grounded visual generation.