Vari-gram language model based on word clustering

袁里驰 · Acta Scientiarum Naturalium Universitatis Sunyatseni · 2012

基于范畴的统计语言模型是一个重要方法解决稀少的数据的问题。但是有二个瓶颈:1 ) 词聚类的问题。它是难的与好性能和更少的计算发现一个合适的聚类方法。2 ) 基于班的方法总是失去预言能力在不同的域改编文本。以便在问题上面解决,由利用相互的信息的词类似的一个定义被介绍。基于词类似,词集合类似的定义被给。实验证明基于类似聚类算法的那个词比处于速度和表演的常规贪婪聚类方法好,并且困惑从 283 ~ 218 被减少。同时,一个绝对加权的差别方法被介绍并且被用来构造有好预言能力的 vari 克语言模型。vari 克模型的困惑在中国语料库上从 234.65 ~ 219.14 被减少,并且与基于范畴的模型相比在英语语料库上从 195.56 ~ 184.25 被减少。

Read the paper · More papers on PaperTik