IndustryBench: Het verkennen van de industriële kennisgrenzen van LLM's
IndustryBench: Probing the Industrial Knowledge Boundaries of LLMs
May 11, 2026
Auteurs: Songlin Bai, Xintong Wang, Linlin Yu, Bin Chen, Zhiang Xu, Yuyang Sheng, Changtong Zan, Xiaofeng Zhu, Yizhe Zhang, Jiru Li, Mingze Guo, Ling Zou, Yalong Li, Chengfu Huo, Liang Ding
cs.AI
Samenvatting
In industriële inkoop is een LLM-antwoord alleen nuttig als het een normencontrole doorstaat: aanbevolen materiaal moet overeenkomen met de bedrijfsomstandigheid, elke parameter moet een gereguleerde drempel respecteren, en geen enkele procedure mag in tegenspraak zijn met een veiligheidsclausule. Gedeeltelijke correctheid kan veiligheidskritieke tegenstrijdigheden maskeren die geaggregeerde LLM-benchmarks zelden vastleggen. Wij introduceren IndustryBench, een benchmark met 2.049 items voor industriële inkoop-QA in het Chinees, gebaseerd op Chinese nationale normen (GB/T) en gestructureerde industriële productregistraties, georganiseerd in zeven capaciteitsdimensies, tien industriecategorieën en panel-afgeleide moeilijkheidsniveaus, met item-uitgelijnde Engelse, Russische en Vietnamese weergaven. Onze constructiepijplijn verwerpt 70,3% van de door LLM gegenereerde kandidaten in een zoekgebaseerde externe-verificatiefase, wat aangeeft hoe onbetrouwbaar industriële QA blijft na alleen LLM-filtering.
Onze evaluatie ontkoppelt ruwe correctheid, gescoord door een Qwen3-Max-beoordelaar die is gevalideerd met κ_w = 0,798 ten opzichte van een domeinexpert, van een afzonderlijke veiligheidsschendingscontrole (SV) tegen brontteksten. Bij 17 modellen in het Chinees en een 8-model overlap over vier talen vinden we: (i) het beste systeem haalt slechts 2,083 op de 0–3 beoordelingsschaal, wat aanzienlijke ruimte voor verbetering laat; (ii) Standaarden & Terminologie is de meest hardnekkige capaciteitszwakte en overleeft item-uitgelijnde vertaling; (iii) uitgebreid redeneren verlaagt de veiligheidsgecorrigeerde scores voor 12 van de 13 modellen, voornamelijk door het introduceren van niet-ondersteunde veiligheidskritieke details in langere eindantwoorden; en (iv) veiligheidsschendingspercentages herschikken de ranglijst – GPT-5.4 stijgt van rang 6 naar rang 3 na SV-correctie, terwijl Kimi-k2.5-1T-A32B zeven posities zakt.
Industriële LLM-evaluatie vereist daarom bron-gebaseerde, veiligheidsbewuste diagnose in plaats van geaggregeerde nauwkeurigheid. Wij geven IndustryBench vrij met alle prompts, scripts voor scoreberekening en datasetdocumentatie.
English
In industrial procurement, an LLM answer is useful only if it survives a standards check: recommended material must match operating condition, every parameter must respect a regulated threshold, and no procedure may contradict a safety clause. Partial correctness can mask safety-critical contradictions that aggregate LLM benchmarks rarely capture. We introduce IndustryBench, a 2,049-item benchmark for industrial procurement QA in Chinese, grounded in Chinese national standards (GB/T) and structured industrial product records, organized by seven capability dimensions, ten industry categories, and panel-derived difficulty tiers, with item-aligned English, Russian, and Vietnamese renderings. Our construction pipeline rejects 70.3% of LLM-generated candidates at a search-based external-verification stage, calibrating how unreliable industrial QA remains after LLM-only filtering.Our evaluation decouples raw correctness, scored by a Qwen3-Max judge validated at κ_w = 0.798 against a domain expert, from a separate safety-violation (SV) check against source texts. Across 17 models in Chinese and an 8-model intersection over four languages, we find: (i) the best system reaches only 2.083 on the 0--3 rubric, leaving substantial headroom; (ii) Standards & Terminology is the most persistent capability weakness and survives item-aligned translation; (iii) extended reasoning lowers safety-adjusted scores for 12 of 13 models, primarily by introducing unsupported safety-critical details into longer final answers; and (iv) safety-violation rates reshuffle the leaderboard -- GPT-5.4 climbs from rank 6 to rank 3 after SV adjustment, while Kimi-k2.5-1T-A32B drops seven positions.Industrial LLM evaluation therefore requires source-grounded, safety-aware diagnosis rather than aggregate accuracy. We release IndustryBench with all prompts, scoring scripts, and dataset documentation.