WikiNER-fr-gold: Un corpus NER de referencia
WikiNER-fr-gold: A Gold-Standard NER Corpus
October 29, 2024
Autores: Danrun Cao, Nicolas Béchet, Pierre-François Marteau
cs.AI
Resumen
En este artículo abordamos la calidad del corpus WikiNER, un corpus multilingüe de Reconocimiento de Entidades Nombradas, y proporcionamos una versión consolidada del mismo. La anotación de WikiNER se realizó de manera semisupervisada, es decir, no se llevó a cabo verificación manual a posteriori. Dicho corpus se denomina de estándar plata. En este documento proponemos WikiNER-fr-gold, que es una versión revisada de la porción en francés de WikiNER. Nuestro corpus consta de una muestra aleatoria del 20% del subcorpus francés original (26,818 oraciones con 700k tokens). Comenzamos por resumir los tipos de entidades incluidas en cada categoría para definir una guía de anotación, y luego procedemos a revisar el corpus. Finalmente, presentamos un análisis de los errores e inconsistencias observados en el corpus WikiNER-fr, y discutimos posibles direcciones para trabajos futuros.
English
We address in this article the the quality of the WikiNER corpus, a
multilingual Named Entity Recognition corpus, and provide a consolidated
version of it. The annotation of WikiNER was produced in a semi-supervised
manner i.e. no manual verification has been carried out a posteriori. Such
corpus is called silver-standard. In this paper we propose WikiNER-fr-gold
which is a revised version of the French proportion of WikiNER. Our corpus
consists of randomly sampled 20% of the original French sub-corpus (26,818
sentences with 700k tokens). We start by summarizing the entity types included
in each category in order to define an annotation guideline, and then we
proceed to revise the corpus. Finally we present an analysis of errors and
inconsistency observed in the WikiNER-fr corpus, and we discuss potential
future work directions.Summary
AI-Generated Summary