Investigation of ASR Systems for Resource-deficient Languages
Dawa I·, Yoshinori Sagisaka, Satoshi Nakamura · Acta Automatica Sinica · 2010
摘要: 由于少数民族语言有其本身的特点, 不能简单地套用现有的连续语音识别的方法. 本文以蒙古语为例, 研讨了声学和语言模型的建立, 并在日本国际电气通信基础技术研究所的连续语音识别器上实现了蒙古语的语音识别系统. 本文侧重于语言模型的建立, 基于蒙古语黏着性语言特点, 提出用相似词聚类方法建立多类N-gram模型. 实验结果显示, 应用我们提出的语言模型, 识别精度比用传统的词的N-gram识别法提高了5.5%. 关键词: 蒙古语 / 黏着语言 / 相似词分类 / 连续语语音识别 / 多类语言模型