ANALYSE MULTIMODALE: estimation informée du contenu et séparation des sources audio
Gabriel Meseguer-Brocal · theses.fr (ABES) · 2020
Cette thèse propose l'étude de l'apprentissage multimodal dans le contexte de signaux musicaux. Tout au long de ce manuscrit, nous nous concentrerons sur l'interaction entre les signaux audio et les informations textuelles.Parmi les nombreuses sources de texte liées à la musique qui peuvent être utilisées (par exemple les critiques, les métadonnées ou les commentaires des réseaux sociaux), nous nous concentrerons sur les paroles.La voix chantée relie directement le signal audio et les informations textuelles d'une manière unique, combinant mélodie et paroles où une dimension linguistique complète l'abstraction des instruments de musique.Notre étude se focalise sur l'interaction audio et paroles pour cibler la séparation de sources et l'estimation de contenu informé.Les stimuli du monde réel sont produits par des phénomènes complexes et leur interaction constante dans divers domaines. Notre compréhension apprend des abstractions utiles qui fusionnent différentes modalités en une représentation conjointe. L'apprentissage multimodal décrit des méthodes qui analysent les phénomènes de différentes modalités et leur interaction afin de s'attaquer à des tâches complexes. Il en résulte des représentations meilleures et plus riches qui améliorent les performances des méthodes d'apprentissage automatique actuelles.Pour développer notre analyse multimodale, nous devons d'abord remédier au manque de données contenant une voix chantée avec des paroles alignées. Ces données sont obligatoires pour développer nos idées. Par conséquent, nous étudierons comment créer une telle base de données en exploitant automatiquement les ressources du World Wide Web. La création de ce type de base de données est un défi en soi qui soulève de nombreuses questions de recherche. Nous travaillons constamment avec le paradoxe classique de la `` poule ou de l'œuf '': l'acquisition et le nettoyage de ces données nécessitent des modèles précis, mais il est difficile de former des modèles sans données. Nous proposons d'utiliser le paradigme enseignant-élève pour développer une méthode où la création de bases de données et l'apprentissage de modèles ne sont pas considérés comme des tâches indépendantes mais plutôt comme des efforts complémentaires. Dans ce processus, les paroles et les annotations non-expertes de karaoké décrivent les paroles comme une séquence de notes alignées sur le temps avec leurs informations textuelles associées. Nous lions ensuite chaque annotation à l'audio correct et alignons globalement les annotations dessus.À cette fin, nous utilisons la corrélation croisée normalisée entre la séquence d'annotation vocale et le vecteur de probabilité de la voix chantée automatiquement, qui est obtenue à l'aide d'un réseau de neurones covolutionnel. En utilisant les données collectées, nous améliorons progressivement ce modèle. Chaque fois que nous avons une version améliorée, nous pouvons à chaque itération corriger et améliorer les données.La collecte de données sur Internet a un prix et est sujette aux erreurs. Nous proposons un nouveau nettoyage des données (un sujet bien étudié pour nettoyer les labels erronées dans les base de données) pour identifier automatiquement les erreurs qui subsistent, nous permettant d'estimer la précision globale de l'ensemble de données, de sélectionner les points qui sont corrects et d'améliorer les données erronées.Notre modèle est formé en comparant automatiquement les paires d'étiquettes correctes probables aux déformations locales de celles-ci. Nous démontrons que la précision d'un modèle de transcription s'améliore considérablement lorsqu'il est formé sur des données filtrées avec notre stratégie proposée par rapport à la précision lorsqu'il est formé à l'aide de la base de données d'origine. Après avoir développé la base de données, nous concentrons nos efforts sur l'exploration de l'interaction entre les paroles et l'audio sur deux tâches différentes.Tout d'abord, nous améliorons la segmentation des paroles en combinant les paroles et l'audio en utilisant une approche de fusion précoce indépendante du modèle. En tant qu'étape de prétraitement, nous créons une représentation de coordonnées sous forme de matrices d’auto-similarité (SMM) de mêmes dimensions pour les deux domaines. Cela nous permet d'adapter facilement un modèle neuronal profond existant pour capturer la structure des deux domaines. À travers des expériences, nous montrons que chaque domaine capture des informations complémentaires qui bénéficient à la performance globale.Deuxièmement, nous explorons le problème de la séparation des sources musicales (c'est-à-dire isoler les différents instruments qui apparaissent dans un mélange audio) en utilisant l'apprentissage conditionné. Dans ce paradigme, nous visons à contrôler efficacement les modèles basés sur les données par des informations de contexte. Nous présentons une nouvelle approche basée sur l'U-Net qui met en œuvre l'apprentissage conditionné à l'aide de la modulation linéaire par fonctionnalité (FiLM). Nous formalisons d'abord le problème comme une séparation de source multitâche en utilisant un conditionnement faible. Dans ce scénario, notre méthode effectue plusieurs séparations d'instruments avec un seul modèle sans perte de performances, en ajoutant juste un petit nombre de paramètres. Cela montre que nous pouvons contrôler efficacement un réseau neuronal générique avec des informations externes. Nous émettons ensuite l'hypothèse que la connaissance des informations phonétiques alignées est bénéfique pour la tâche de séparation vocale et nous étudions comment nous pouvons intégrer des mécanismes de conditionnement dans la séparation des sources informées en utilisant un conditionnement fort. Nous adaptons la technique FiLM pour améliorer la séparation des sources vocales une fois que nous connaissons la séquence phonétique alignée. Nous montrons que notre stratégie surpasse l'architecture standard non conditionnée.Enfin, nous résumons nos contributions en mettant en évidence les principales questions de recherche que nous abordons et nos propositions de réponses. Nous discutons en détail des travaux futurs potentiels, en traitant chaque tâche individuellement. Nous proposons de nouveaux cas d'utilisation de notre jeu de données ainsi que des moyens d'améliorer sa fiabilité, et analysons notre approche conditionnelle et les différentes stratégies pour l'améliorer.