A Substitution-Translation-Restoration Framework for Handling Unknown Words in Statistical Machine Translation

张家俊, 翟飞飞, 宗成庆 · Acta Scientiarum Naturalium Universitatis Sunyatseni · 2013

未知的词是极大地影响翻译质量的关键因素之一。传统地,将近,所有相关研究集中于获得未知的词的翻译。然而,这些途径有二劣势。在一方面,他们通常依靠象双语的网数据那样的许多另外的资源;在另一方面,他们不能保证好改组和包围词的词汇选择。这篇论文在在统计机器翻译(SMT ) 处理未知的词上给一个新观点。而不是作大努力发现未知的词的翻译,我们集中于在测试句子决定未知的词的语义函数并且在翻译进程使语义函数未改变。这样,尽管他们仍然是 untranslated,未知的词能帮助改组的短语和他们的包围的词的词汇选择。以便决定一个未知的词的语义功能,我们雇用分布语义模特儿和双向语言模型。在 Chinese-to-English 翻译的基于短语、语言学基于句法的 SMT 模型的广泛的实验证明我们的方法罐头实质地改进翻译质量。

Read the paper · More papers on PaperTik