Advances on speaker recognition in non collaborative environments

Antonio Villalba López · Dialnet (Universidad de la Rioja) · 2014

Generalmente, el rendimiento de los sistemas de reconocimiento de locutor se mide en condiciones ideales, donde la voz es relativamente limpia, los usuarios son colaborativos, y hay suficientes datos disponibles para entrenar modelos de locutor y de canal. No obstante, cuando aplicamos verificacion de locutor en entornos reales nos enfrentamos a retos que merecen investigacion en profundidad. Esta tesis aborda algunos de ellos. El rendimiento de los sistemas de verificacio ?n puede empeorar debido a multiple causas: ruido, reverberacion, idiomas o canales distintos de los utilizados en la fase de desarrollo, etc. De este modo, saber que podemos confiar en las decisiones del sistema de verificacion es fundamental. Esto nos motivo a estudiar formas de estimar la fiabilidad de las decisiones. Trabajamos en soluciones basadas en redes bayesianas. Las redes modelan las relaciones de causalidad entre la fiabilidad de la decision, el score del sistema de verificacion, y un conjunto de medidas de calidad calculadas sobre las senales de inscripcion y test del trial. La contribucion mas importante de esta tesis, en este aspecto, es una red bayesiana que describe como varian las distribuciones de scores cuando los audios del trial estan distorsionados. Esta red supone que existen dos scores: uno observado y otro oculto. El score observado o score ruidoso es el que se obtiene del sistema de verificacion, mientras que el score oculto o score limpio es un score ideal que se obtendria si se tuviese voz de alta calidad. A partir de la distribucion a posteriori del score limpio, se puede inferir la fiabilidad del trial. Esta aproximacion consiguio mejores resultados que metodos previos. Actualmente, el paradigma de los i-vectors es el estado del arte en verificacion de locutor superando, en la mayoria de tareas, al joint factor analysis o los support vector machines (SVM). Por esta razon, otra de las partes de la tesis se enfoco en problemas que aparecen cuando se modelan las distribuciones de i-vectors. Se considero el problema de tener simultaneamente i-vectors grabados en diferentes condiciones como multiples tipos de canal, tipos o niveles de ruido. Introdujimos una variante de probabilistic discriminant analysis (PLDA) que intenta aproximar este problema de manera teoricamente correcta permitiendo que existan diferente distribuciones de canal para cada condicion. Otro problema que se abordo fue como tener en cuenta la incertidumbre acerca de los parametros del modelo que existe cuando la cantidad de datos de desarrollo es pequena en comparacion con la dimension de los i-vectors. Se propuso calcular la distribucion a posteriori del modelo dados los datos de desarrollo, y despues usar esta distribucion para evaluar los ratios de verosimilitud integrando los para ?metros del modelo. Con este metodo se obtuvo una mejora significativa con i-vectors sin normalizacion en longitud. Finalmente, se abordo el problema de entrenar PLDA en dominios con escasos datos de desarrollo. Se propuso adaptar un modelo entrenado para otro dominio, con datos suficientes, al dominio de interes usando Maximum a posteriori. En la ultima parte de la tesis, nos interesamos por los ataques a sistemas de verificacion de locutor. Se trabajo en detectar ataques de spoofing y tampering. Ambos ataques tienen intenciones opuestas. Mientras que el spoofing intenta que un impostor suplante la identidad del usuario bajo test, el tampering intenta ocultar la identidad del locutor para no ser detectado. Nos enfocamos en ataques de baja tecnologia, los cuales pueden ser llevados a cabo por cualquier criminal sin necesidad de tener conocimientos de procesado de voz. En el caso del spoofing, se estudiaron ataques basados en grabar la voz del usuario y reproducirla sobre el sistema. En sistemas dependientes del texto, el ataque tambien implica crear la contrasena cortando y pegando extractos de varias grabaciones de la victima. En cuanto al tampering, se estudiaron ataques basados en cubrir la boca con la mano o con un panuelo; y denasalizacion pellizcando las fosas nasales. Los sistemas para detectar los ataques estuvieron basados en caracteristicas acusticas y clasificadores Gaussian mixture models y SVM; y seguimiento de contornos de Mel filtered cepstral coefficients y pitch. La fusion del verificador de locutor con los detectores de ataques mejoro la robustez del sistema. Abordar los asuntos arriba descritos es crucial para poder aplicar verificacion de locutor en el mundo real. En un amplio rango de aplicaciones ?desde forenses a banca?, se necesita evaluar si las decisiones del verificador de locutor son fiables dado que los errores pueden acarrear grandes perdidas. Para mejorar la fiabilidad, los modelos estadisticos deben estar optimizados para la tarea en cuestion. Los nuevos metodos de modelado deberian entrenar modelos lo mas generales posible o ser capaces de adaptar modelos entre dominios necesitando para ello los minimos recursos. Finalmente, las medidas contra ataques mejorarian la aceptacion de los sistemas de biometria de voz. Se necesitan recursos y protocolos de evaluacion comunes para poder avanzar en este campo y fomentar la colaboracion entre instituciones.

Read the paper · More papers on PaperTik