Speaker recognition with small training requirements using a combination of VQ and DHMM
Minh N. Do, Michael Wagner · 2020
Il est bien connu que la quantisation vectorielle (VQ) est une méthode solide pour des systèmes de la reconnaissance du locuteur qui demandent peu de données pour l'entraînement. Toutefois la méthode VQ conventionnelle utilise seulement les mesures de distorsion et ne s'occupe pas de la séquence des codes VQ. Nous proposons d ' étendre la méthode de distorsion VQ par combiner les distorsions avec la probabilité de la séquence des codes VQ provenant d'un modèle de Markov discret (DHMM). Cette méthode convient le mieux pour les systèmes de la reconnaissance de la parole et du locuteur combinés. Nos expériences avec la base de données TI46 montrent que la mesure combinée donne des résultats mieux que les mesures VQ et DHMM seules. Vector Quantisation (VQ) has been shown to be robust in speaker recognition systems which require a small amount of training data. However the conventional VQ-based method only uses distortion measurements and discards the sequence of quantised codewords. In this paper we propose a method which extends the VQ distortion method by combining it with the likelihood of the sequence of VQ indices against a discrete hidden Markov model (DHMM). The method is particularly suitable for combined speech recognition and speaker recognition systems. Experiments on the TI46 database show that the combined score gives better performance than both the conventional VQ-based and DHMM-based methods.