Croatian Twitter training corpus ReLDI-NormTagNER-hr 2.0
Nikola Ljubešić, Tomaž Erjavec, Vuk Batanović, Маја Miličević, Tanja Samardžić · Clarin.SI Repository (Clarin.SI) · 2017
ReLDI-NormTagNER-hr 2.0 is a manually annotated corpus of Croatian tweets. It is meant as a gold-standard training and testing dataset for tokenisation, sentence segmentation, word normalisation, morphosyntactic tagging, lemmatisation and named entity recognition of non-standard Croatian. Each tweet is also annotated for its automatically assigned standardness levels (T = technical standardness, L = linguistic standardness). As an update to version 1.1, 2.0 adds annotations for named entities.