IndustryBench: Investigando as Fronteiras do Conhecimento Industrial dos LLMs
IndustryBench: Probing the Industrial Knowledge Boundaries of LLMs
May 11, 2026
Autores: Songlin Bai, Xintong Wang, Linlin Yu, Bin Chen, Zhiang Xu, Yuyang Sheng, Changtong Zan, Xiaofeng Zhu, Yizhe Zhang, Jiru Li, Mingze Guo, Ling Zou, Yalong Li, Chengfu Huo, Liang Ding
cs.AI
Resumo
Nas aquisições industriais, a resposta de um LLM é útil apenas se sobreviver a uma verificação de normas: o material recomendado deve corresponder à condição operacional, cada parâmetro deve respeitar um limite regulamentado e nenhum procedimento pode contradizer uma cláusula de segurança. A correção parcial pode mascarar contradições críticas de segurança que os benchmarks agregados de LLM raramente capturam. Apresentamos o IndustryBench, um benchmark de 2.049 itens para QA de aquisições industriais em chinês, fundamentado nas normas nacionais chinesas (GB/T) e em registros estruturados de produtos industriais, organizado por sete dimensões de capacidade, dez categorias industriais e níveis de dificuldade derivados por painel, com versões em inglês, russo e vietnamita alinhadas por item. Nosso pipeline de construção rejeita 70,3% dos candidatos gerados por LLM em uma etapa de verificação externa baseada em busca, calibrando o quão pouco confiável a QA industrial permanece após a filtragem apenas por LLM.
Nossa avaliação separa a correção bruta, pontuada por um juiz Qwen3-Max validado com κ_w = 0,798 contra um especialista do domínio, de uma verificação separada de violação de segurança (VS) contra os textos fonte. Em 17 modelos em chinês e uma interseção de 8 modelos em quatro idiomas, constatamos: (i) o melhor sistema atinge apenas 2,083 na rubrica de 0 a 3, deixando margem substancial; (ii) Padrões e Terminologia é a fraqueza de capacidade mais persistente e sobrevive à tradução alinhada por item; (iii) o raciocínio estendido reduz as pontuações ajustadas por segurança para 12 de 13 modelos, principalmente ao introduzir detalhes críticos de segurança não suportados em respostas finais mais longas; e (iv) as taxas de violação de segurança reorganizam o quadro de classificação — GPT-5.4 sobe da posição 6 para a posição 3 após o ajuste por VS, enquanto Kimi-k2.5-1T-A32B cai sete posições.
Portanto, a avaliação industrial de LLMs requer um diagnóstico fundamentado nas fontes e consciente da segurança, em vez de precisão agregada. Disponibilizamos o IndustryBench com todos os prompts, scripts de pontuação e documentação do conjunto de dados.
English
In industrial procurement, an LLM answer is useful only if it survives a standards check: recommended material must match operating condition, every parameter must respect a regulated threshold, and no procedure may contradict a safety clause. Partial correctness can mask safety-critical contradictions that aggregate LLM benchmarks rarely capture. We introduce IndustryBench, a 2,049-item benchmark for industrial procurement QA in Chinese, grounded in Chinese national standards (GB/T) and structured industrial product records, organized by seven capability dimensions, ten industry categories, and panel-derived difficulty tiers, with item-aligned English, Russian, and Vietnamese renderings. Our construction pipeline rejects 70.3% of LLM-generated candidates at a search-based external-verification stage, calibrating how unreliable industrial QA remains after LLM-only filtering.Our evaluation decouples raw correctness, scored by a Qwen3-Max judge validated at κ_w = 0.798 against a domain expert, from a separate safety-violation (SV) check against source texts. Across 17 models in Chinese and an 8-model intersection over four languages, we find: (i) the best system reaches only 2.083 on the 0--3 rubric, leaving substantial headroom; (ii) Standards & Terminology is the most persistent capability weakness and survives item-aligned translation; (iii) extended reasoning lowers safety-adjusted scores for 12 of 13 models, primarily by introducing unsupported safety-critical details into longer final answers; and (iv) safety-violation rates reshuffle the leaderboard -- GPT-5.4 climbs from rank 6 to rank 3 after SV adjustment, while Kimi-k2.5-1T-A32B drops seven positions.Industrial LLM evaluation therefore requires source-grounded, safety-aware diagnosis rather than aggregate accuracy. We release IndustryBench with all prompts, scoring scripts, and dataset documentation.