Apprentissage Semi-supervisé Basé surles Graphes Avec des GraphesManquants et Bruités
Mariana Vargas Vieyra · theses.fr (ABES) · 2021
Au cours des dernières années, les méthodes d’apprentissage automatique ont été intégréesdans divers systèmes de traitement du langage naturel. Ces méthodes ont montré des résultatsimpressionnants dans une variété de tâches dans de multiples domaines, en particulierpar l’apprentissage supervisé. Cependant, ces méthodes reposent généralement sur degrandes quantités de données étiquetées, ce qui implique une forte intervention humainedans le pipeline de modélisation et un coût potentiel élevé pour l’annotation des données.L’apprentissage semi-supervisé basé sur les graphes (GSSL) est un cadre théorique quiatténue ces problèmes en exploitant les informations fournies par les données non étiquetées.Il prend en entrée un ensemble de données et un graphe qui représente les connexions entreles éléments, étiquetés et non étiquetés. Un obstacle dans l’utilisation de GSSL est qu’ungraphe n’est pas toujours disponible, et bien qu’il existe des techniques heuristiques pourles construire, elles ne parviennent généralement pas à capturer la véritable topologie desdonnées.Dans cette thèse, nous proposons deux méthodes originales pour traiter les scénarios où lesdonnées étiquetées sont rares et où le graphe n’est disponible ou est seulement une observationbruitée d’un vrai graphe inconnu. Notre première méthode combine l’apprentissage desgraphes et l’apprentissage des métriques pour apprendre conjointement un graphe et unetransformation de données que nous pouvons ensuite insérer dans un algorithme GSSLstandard, comme par exemple Label Spreading ou Graph Convolutional Networks. Pournotre deuxième méthode, nous adoptons une approche probabiliste et utilisons les outilsdes modèles génératifs pour construire un cadre dans lequel nous inférons conjointementun graphe et les paramètres d’un modèle de classification semi-supervisée "end-to-end".Nous montrons empiriquement que nos méthodes donnent des résultats compétitifs dansla classification de textes. De plus, nous obtenons des graphes spécifiques aux tâches quicapturent des propriétés intéressantes sur les données. Finalement, nous identifions les défiset discutons des directions potentielles pour les relever.