WikiNER-fr-gold: Золотой стандартный корпус для распознавания именованных сущностей.
WikiNER-fr-gold: A Gold-Standard NER Corpus
October 29, 2024
Авторы: Danrun Cao, Nicolas Béchet, Pierre-François Marteau
cs.AI
Аннотация
В данной статье мы рассматриваем качество корпуса WikiNER, многоязычного корпуса для распознавания именованных сущностей, и предоставляем его сконсолидированную версию. Аннотация WikiNER была создана в полу-супервизионном режиме, то есть без последующей ручной верификации. Такой корпус называется серебряным стандартом. В данной статье мы предлагаем WikiNER-fr-gold, который является пересмотренной версией французской части WikiNER. Наш корпус состоит из случайно отобранных 20% от исходного французского подкорпуса (26 818 предложений с 700 тыс. токенов). Мы начинаем с обзора типов сущностей, включенных в каждую категорию, для определения руководства по аннотации, а затем приступаем к пересмотру корпуса. Наконец, мы представляем анализ ошибок и несоответствий, выявленных в корпусе WikiNER-fr, и обсуждаем потенциальные направления для будущих исследований.
English
We address in this article the the quality of the WikiNER corpus, a
multilingual Named Entity Recognition corpus, and provide a consolidated
version of it. The annotation of WikiNER was produced in a semi-supervised
manner i.e. no manual verification has been carried out a posteriori. Such
corpus is called silver-standard. In this paper we propose WikiNER-fr-gold
which is a revised version of the French proportion of WikiNER. Our corpus
consists of randomly sampled 20% of the original French sub-corpus (26,818
sentences with 700k tokens). We start by summarizing the entity types included
in each category in order to define an annotation guideline, and then we
proceed to revise the corpus. Finally we present an analysis of errors and
inconsistency observed in the WikiNER-fr corpus, and we discuss potential
future work directions.Summary
AI-Generated Summary