Discovering Acoustic Units from Speech: a Bayesian Approach

Lucas Ondel · HAL (Le Centre pour la Communication Scientifique Directe) · 2021

Dès leur plus jeune age, les enfants montrent une capacité innée d’apprendre les structures linguistiques du signal de la parole, bien avant de savoir lire et écrire. A l’inverse, les systèmes de reconnaissance vocale nécessitent de large ensembles de données préalablement transcrits pour atteindre un faible taux d’erreur. Le champ de recherche relativement récent de « l’apprentissage de la parole de manière non-supervisée » s’efforce de donner aux machines des capacités d’apprentissages similaires. Cette thèse s’inscrit dans cet effort de recherche et se concentre sur leproblème d’apprendre un ensemble d’unités acoustiques pour une langue à partir enregistrements audios non-transcrits. Plus particulièrement, nous explorons le potentiel de « l’inférence bayésienne » pour cette tâche.Dans une première partie, nous revisitons le modèle bayésien non-paramétrique de l’état de l’art et nous proposons un algorithme d’apprentissage efficace d’inférence variationnelle bayésienne. Notre approche se base sur la construction du processus de Dirichlet à partir du « découpage de bâton » qui permet de représenter le modèle comme un modèle de Markov caché de type « boucle phonétique ». Avec ce modèle et l’utilisation de l’approximation des champs moyens de la distribution à posteriori, l’apprentissage s’apparente à un algorithme d’espérance-maximisation. Lesrésultats montrent que cette approche obtient un meilleur clustering que le modèle original tout en étant bien plus rapide. Dans une deuxième partie, nous nous attelons à la tâche de correctement définir une distribution a priori sur les possibles unités acoustiques. Pour arriver à nos fins, nous présentons le concept de modèle de sous-espaces généralisés, un cadre théorique qui nous permet de définir des distributions plongées dans des variétés de petites dimensions. Avec cet outil, nous apprenons un sous-espace phonétique – un continuum de plongement phonétique – à partir d‘enregistrements transcrits dans plusieurs langues. Ensuite, le sous-espace est utilisé pour contraindre notre système pour apprendredes unités acoustiques qui sont similaires aux phones des autres langues. Les résultatsexpérimentaux montrent que cette approche améliore de manière significative la qualité du clustering et la la précision de la segmentation. Finalement, nous améliorons notre système d’extraction d’unités acoustiques en utilisant un processus de Dirichlet hiérarchique au lieu d’un processus de Dirichlet classique. En faisant cela, nous introduisons un modèle le langue phonotactique bayésien dans notre système. Cette approche capture de manière plus fine la structure phonétique de la langue cible et, par voie de conséquence, améliore le clustering du signal de la parole. Aussi, afin de mieux exploiter le modèle de langue phonotactique, nous proposons un algorithme d’inférence variationnelle bayésienne qui peut pondérer le rôle du modèle acoustique et du modèle de langue pendant l’apprentissage.

Read the paper · More papers on PaperTik