Improved modelling for robust speech recognition
Pau Paches Leal · Dialnet (Universidad de la Rioja) · 2000
Una de las lineas seguidas en esta tesis es intentar conocer mejor nuevas estrategias para mejorar el reconocimiento del habla. En este trabajo, se presenta un nuevo algoritmo (MCA) para compensar las inhomogeneidades en el dominio del Espectro de Modulacion, que tiene cierto sentido perceptual y en el que se pueden representar las variaciones temporales de la senal. MCA es un procedimiento de Maxima Verosimilitud para la estimacion automatica de filtros en el espectro de modulacion, de cara a compensar distorsiones en este dominio. Dos bases de datos de proposito general, SpeechDat espanola y SpeechDat catalana, se usan en este trabajo. La modelizacion independiente de la tarea, que consiste en entrenar modelos foneticos generales a partir de frases equilibradas foneticamente, es la estrategia usada aqui. Se lleva a cabo un estudio sobre las unidades practicas para crear sistemas independientes de la tarea de tamano mediano. Unidades mas sencillas que hacen suposiciones simplificadoras sobre los efectos del contexto se comparan con los muy conocidos trifonemas. Metodos de ligadura de estados basados en arboles de decision se usan ampliamente aqui para hacer entrenables las unidades dependientes del contexto usadas. Se efectuan dos estudios independientes, uno para un sistema de reconocimiento en castellano y el otro para un sistema de reconocimiento en catalan. Un diccionario fonetico se necesita para entrenar un sistema de reconocimiento basado en unidades sublexicas. La obtencion de un diccionario fonetico es muy costosa en tiempo. Un conversor automatico grafema-fonema, Segre, para la lengua catalana ha sido desarrollado en el marco de esta tesis y se ha usado para construir sistemas de reconocimiento en catalan para la base SpeechDat. La caracteristica principal de este transcriptor es que las reglas de conversion no estan fijas dentro del codigo del programa sino que s