Ko-WideSearch: Een Koreaanse breedte-zoekbenchmark voor exhaustieve set-opsomming door webagenten
Ko-WideSearch: A Korean Breadth-Search Benchmark for Exhaustive Set Enumeration by Web Agents
June 25, 2026
Auteurs: Minbyul Jeong
cs.AI
Samenvatting
Web-agent benchmarks meten overwegend diepte – het achterhalen van één obscure antwoord achter een reeks constraints – terwijl breedte, het uitputtend opsommen van een gesloten verzameling en het invullen van de attributen van elk item, nauwelijks wordt geëvalueerd, vooral buiten het Engels. Breedte is ook moeilijk te bouwen: het certificeren dat een gouden set volledig is en elke cel correct, is veel duurder dan het controleren van één enkel antwoord. Ik introduceer Ko-WideSearch, een Koreaans breedte-zoekbenchmark, gebouwd door een geautomatiseerde synthesize-en-verify-pijplijn. Elke taak noemt een set-ouderentiteit – een tv-seizoen, een dynastie, een competitie, een bestuurlijke regio, een verkiezing – en vraagt om de volledige lidmaatschap plus een per-item attributentabel, beoordeeld op Item-, Column- en Row-F1. Het omvat 228 tabellen over 190 entiteiten en zestien categorieën in drie moeilijkheidsniveaus, ingesteld door twee structurele knoppen die ik onafhankelijk draai – tabelbreedte en een 2D-composietsleutel – zodat het cross-productlidmaatschap oploopt van 0% naar 100% over de niveaus heen. Een enkele normalisatie-bewuste comparator wordt gedeeld tussen goudconstructie en beoordeling, zodat stabiele datum- en aantalkolommen niet worden overgeselecteerd op basis van alleen opmaak. Bij twintig web-agents is de mislukking consistent: agents herstellen de set maar niet de rijen (bijv. Item-F1 92,8 tegen Row-F1 53,7), de nauwkeurigheid daalt gestaag naarmate de knoppen worden aangescherpt, en noch meer zoeken noch meer uitgeven overbrugt de kloof. Uitgesplitst naar cel, is het moeilijke deel het vinden van de juiste waarde, niet het opmaken ervan: open vrije-tekstcellen falen het meest, terwijl cellen met een standaardantwoord zoals een datum of naam meestal goed uitkomen.
English
Web-agent benchmarks overwhelmingly measure depth -- pinning one obscure answer behind a chain of constraints -- while breadth, exhaustively enumerating a closed set and filling each item's attributes, is barely evaluated, especially outside English. Breadth is also hard to build: certifying that a gold set is complete and every cell correct is far costlier than checking a single answer. I introduce Ko-WideSearch, a Korean breadth-search benchmark built by an automated synthesize-and-verify pipeline. Each task names a set-parent entity -- a TV season, a dynasty, a league, an administrative region, an election -- and asks for its full membership plus a per-item attribute table, graded by Item-, Column-, and Row-F1. It spans 228 tables over 190 entities and sixteen categories across three difficulty tiers, set by two structural knobs I dial independently -- table width and a 2-D composite key -- so cross-product membership climbs from 0\% to 100\% across the tiers. A single normalization-aware comparator is shared between gold construction and grading, so stable date and count columns are not over-dropped on formatting alone. Across twenty web agents, the failure is consistent: agents recover the set but not the rows (e.g.\ Item-F1 92.8 against Row-F1 53.7), accuracy falls steadily as the knobs harden, and neither more search nor more spend closes the gap. Broken down by cell, the hard part is finding the right value, not formatting it: open-ended free-text cells fail most, while cells with a standard answer such as a date or a name usually come out right.