Design and development of the Bulgarian sense-annotated corpus
Svetla Koeva, Svetlozara I. Leseva, Borislav Rizov, Ekaterina Tarpomanova, T. Dimitrova, Hristina Kukova, Maria Todorova · Dialnet (Universidad de la Rioja) · 2011
espanolEl articulo describe la metodologia de la compilacion y la anotacion del Corpus Semanticamente Anotado Bulgaro - un corpus anotado de modo manual y consta de mas de 100 mil palabras donde en cada unidad linguistica se le ha atribuido un significado conforme al Wordnet Bulgaro. El articulo presenta, asimismo, el programa de anotacion Chooser. Han sido descritas las convenciones linguisticas y las soluciones practicas adoptadas en el proceso de la anotacion. Al final, el articulo describe una de las aplicaciones esenciales de BulSemCor como un corpus de entrenamiento orientado a desarrollar el sistema de desambiguacion de la lengua bulgara. EnglishThis paper describes the methodology of compilation and annotation of the Bulgarian Sense-Annotated Corpus - a manually annotated corpus of over 100,000 words in which each lexical unit (LU) is assigned a sense according to the Bulgarian wordnet. The paper gives a brief outline of the corpus representation, the functionalities of the annotation tool Chooser, and sketches the linguistic conventions and practical considerations adopted in the process of corpus annotation. Finally, the paper describes one of the major applications of the Bulgarian Sense-Annotated Corpus as a training corpus for a word-sense disambiguation system for Bulgarian.