Generating Chinese named entity data from parallel corpora
Ruiji, Fu, Qin Qin, Adeline Su Yien Ting, Liu . · Acta Scientiarum Naturalium Universitatis Sunyatseni · 2014
注解训练语料库的命名实体识别(NER ) 是为监督 NER 途径的一个昂贵却必要的过程。这份报纸论述一个一般框架产生从平行语料库训练数据的大规模 NER。在我们的方法,我们首先在一个双语的语料库的一个方面上采用一个高效 NER 系统。然后,我们投射命名实体(NE ) 到其它的标签根据词水平排列站在一起。最后,我们建议几策略选择训练数据的高质量的标记汽车的 NER。我们用一个英汉平行语料库把我们的途径用于中国 NER。试验性的结果证明我们的途径能收集高质量的标记的数据并且能帮助改进中国 NER。