Robust diarization for speaker characterization

Carlos Vaquero Avilés Casco · Dialnet (Universidad de la Rioja) · 2011

La tarea de caracterizacion de locutores, cuyo objetivo es describir las peculiaridades particulares y distintivas del habla de una persona, es esencial para muchas tecnologias y aplicaciones basadas en el habla. El ejemplo mas claro es la biometria basada en la voz, pero tambien el reconocimiento del habla puede aprovecharse de la caracterizacion de locutores utilizando tecnicas de adaptacion al locutor. Las tecnicas de caracterizacion de locutores requiren grandes bases de datos con etiquetas de locutor para operar, pero en muchos entornos, incluso cuando existen bases de datos apropiadas, estas no son utiles para la caracterizacion de locutores. Un problema habitual es que cada grabacion de la base datos contiene muchos locutores, y no existen etiquetas indicando cuando habla cada locutor. La solucion a este problema es el uso de diarizacion de locutores, cuyo objetivo es responder a la pregunta ?Quien ha hablado en cada momento?. Esta tesis se centra en proporcionar robustez a la diarizacion de locutores para que sea utilizada en aplicaciones reales de caracterizacion de locutores. Para ello, se persiguen dos objetivos complementarios: en primer lugar, se requiere el desarrollo de sistemas de diarizacion precisos, para asegurar que las aplicaciones de caracterizacion de locutores operaran correctamente cuando utilicen grabaciones con mas de un locutor. En segundo lugar, se requieren tecnicas para la evaluacion de la calidad de las hipotesis de diarizacion, para detectar aquellas grabaciones que serian fiables para la caracterizacion de locutores. Para alcanzar estos objetivos, se revisan las tecnicas de diarizacion tradicionales, asi como el impacto que tienen los errores de diarizacion en una tarea de verificacion de locutor. Se demuestra que las estrategias tradicionales de diarizacion pueden no ser suficientemente precisas para determinadas aplicaciones. Para resolver este problema, se propone una nueva aproximacion para diarizacion de locutores basada en los recientes avances obtenidos en el campo de reconocimiento de locutores. Estos avances incrementan la precision de la diarizacion y verificacion de locutores cuando se consideran conversaciones telefonicas de dos locutores, un entorno muy habitual en aplicaciones biometricas basadas en voz. Despues, el analisis se extiende a problemas con mas de dos locutores, y se analizan nuevas tecnicas de clustering de locutores. El sistema de diarizacion propuesto tambien obtiene mejores prestaciones que los sistemas tradicionales cuando se desconoce el numero de locutores. Finalmente, se incluye un estudio sobre evaluacion de calidad para diarizacion. Se proponen varias medidas de confianza y una metodologia para la deteccion de grabaciones con hipotesis de diarizacion fiables. Esta metodologia permite recuperar una parte de una base de datos dada, compuesta por grabaciones fiables, de forma que una aplicacion de caracterizacion de locutores no obtendra una degradacion significativa debido a errores de diarizacion. Se demuestra que la metodologia es util para aplicaciones de caracterizacion de locutores tales como verificacion o clustering de locutores. Ademas se demuestra que, en combinacion con una estrategia de generacion y seleccion de hipotesis, incrementa la precision de la diarizacion de locutores. La recuperacion de grabaciones fiables es muy util para procesar una base de datos de forma semisupervisada, ya que solo es necesario inspeccionar manualmente la porcion de la base de datos no detectada como fiable. La porcion a inspeccionar sera pequena cuando se consideren sistemas de diarizacion precisos, como el que se propone en esta tesis.

Read the paper · More papers on PaperTik