WikiNER-fr-gold: Um Corpus NER Padrão-Ouro
WikiNER-fr-gold: A Gold-Standard NER Corpus
October 29, 2024
Autores: Danrun Cao, Nicolas Béchet, Pierre-François Marteau
cs.AI
Resumo
Neste artigo, abordamos a qualidade do corpus WikiNER, um corpus multilíngue de Reconhecimento de Entidades Nomeadas, e fornecemos uma versão consolidada do mesmo. A anotação do WikiNER foi produzida de forma semi-supervisionada, ou seja, nenhuma verificação manual foi realizada posteriormente. Esse corpus é chamado de padrão prata. Neste artigo, propomos o WikiNER-fr-ouro, que é uma versão revisada da porção francesa do WikiNER. Nosso corpus consiste em uma amostra aleatória de 20% do subcorpus francês original (26.818 frases com 700k tokens). Começamos resumindo os tipos de entidades incluídas em cada categoria para definir um guia de anotação e, em seguida, procedemos com a revisão do corpus. Por fim, apresentamos uma análise dos erros e inconsistências observados no corpus WikiNER-fr e discutimos possíveis direções para trabalhos futuros.
English
We address in this article the the quality of the WikiNER corpus, a
multilingual Named Entity Recognition corpus, and provide a consolidated
version of it. The annotation of WikiNER was produced in a semi-supervised
manner i.e. no manual verification has been carried out a posteriori. Such
corpus is called silver-standard. In this paper we propose WikiNER-fr-gold
which is a revised version of the French proportion of WikiNER. Our corpus
consists of randomly sampled 20% of the original French sub-corpus (26,818
sentences with 700k tokens). We start by summarizing the entity types included
in each category in order to define an annotation guideline, and then we
proceed to revise the corpus. Finally we present an analysis of errors and
inconsistency observed in the WikiNER-fr corpus, and we discuss potential
future work directions.Summary
AI-Generated Summary