Construction de graphes de connaissances à partir de textes avec une intelligence artificielle explicable et centrée-utilisateur·ice

Hugo Ayats · theses.fr (ABES) · 2023

1. C'est pourquoi le terme apprentissage machine est parfois préféré au terme intelligence artificielle pour décrire ce type de technologie.2. La plus connue étant sans doute le cas de COMPAS, un modèle utilisé dans certains tribunaux aux États-Unis pour prédire les risques de récidive, et qui s'est avéré avoir un biais raciste. ContributionsLe travail présenté dans cette thèse est composé de plusieurs contributions, à la fois théoriques et appliquées, dans plusieurs domaines de recherche -IA centrée sur l'utilisateur•ice, traitement automatique du langage naturel, analyse formelle de concepts, extraction d'informations et web sémantique.Workflow centré sur l'utilisateur•ice pour la construction de graphes de connaissances Nous présentons un nouveau modèle de workflow centré sur l'utilisateur•ice pour la construction de graphes de connaissances à partir de textes.Celui-ci est basé sur une modélisation sémantique et syntaxique intermédiaire des textes, générée par une unité de prétraitement.Il comporte également une unité interactive permettant au système d'apprendre à partir des actions de l'utilisateur•ice, et une unité automatisée permettant d'inférer des connaissances fiables directement à partir des actions passées de cellui-ci.Dans son utilisation, ce workflow suit le cycle "production manuelle → suggestions → automatisation" : il est conçu pour agir d'abord comme une interface manuelle pour la création de graphe de connaissances, sur laquelle un module de suggestion vient assister l'utilisateur•ice.Iel peut alors permettre l'automatisation complète de l'extraction des faits en validant certaines de ces suggestions.Ce travail a été publié dans [Aya22].Modélisation du texte en tant que graphe Dans le prolongement de la contribution précédente, nous proposons une modélisation syntaxique et sémantique du texte sous forme de graphe, utilisable comme représentation intermédiaire dans le workflow précédent.Cette modélisation, basée sur l'utilisation d'outils classiques de TALN pour l'analyse syntaxique et sur une base de données lexicale, utilise le standard RDF -dont RDF Schemas -pour sa représentation. Cette contribution est publiée dans [ACF21; ACF22a]. Concepts de voisinsDans le domaine de l'analyse formelle de concepts, plusieurs contributions ont été apportées au cadre mathématique et algorithmique qui sous-tend la notion de concepts de voisins.Tout d'abord, nous formalisons cette notion dans le paradigme général de l'analyse formelle de concepts, au lieu de Graph-FCA, une de ses extensions aux données graphe.Ensuite, nous complétons le travail existant dans Graph-FCA pour permettre un traitement efficace du cas des concepts n-aires.Nous formalisons également la transformation des graphes RDF en graphe contextes -le format des données 9 dans Graph-FCA -en tenant compte des schémas RDF.Enfin, nous présentons CONNOR, une bibliothèque Java pour le calcul des concepts de voisins sur les graphes RDF.Ces travaux sont publiés dans [ACF24; ACF22b]. Extraction de relations dans les textesNous proposons une nouvelle approche pour l'extraction de relations dans les textes, basée sur les concepts de voisins et conçue pour être compatible avec le workflow introduit précédemment.Tout d'abord, nous présentons une architecture en deux étapes pour l'extraction de relations dans les textes, basée sur la séparation entre la détection des relations (différencier les exemples positifs des négatifs) et la classification des relations (identifier le type de relation pour les exemples positifs).Deuxièmement, nous introduisons un module de détection des relations, en affinant un large modèle de langue existant.Ce module est également conçu pour faire partie de l'unité de prétraitement du workflow.Troisièmement, nous proposons une nouvelle approche symbolique et explicable pour la classification des relations, basée sur la modélisation des textes en tant que graphes et sur les concepts de voisins.Cette approche est également conçue pour faire partie de l'unité interactive du workflow présenté précédemment.Enfin, nous évaluons, séparément et conjointement, ces modules sur les tâches de détection, de classification et d'extraction de relations sur un benchmark d'extraction de relations bien connu.Ce travail a été publié dans [ACF21; ACF22a].In this thesis, we present a theorization of a user-centric AI for knowledge construction from text.First presenting itself as a comprehensive interface for the construction of knowledge graphs from text, this approach is based on a progressive automation of the user's actions.To do so, it implements an FCA-based explainable suggestion system, used to produce suggestions of increasing quality based on the user's past actions, and to → automation" cycle: it is conceived to act at first as a manual interface for the knowledge graph completion, on which a suggestion module comes to assist the user.The user then can allow for the full automation of the extraction of facts by validating some of those suggestions.This work has been published in [Aya22].Text Modeling as Graphs In the following of the previous contribution, we propose a syntactic and semantic modeling of text as graph to use as intermediate representation in Thesis OutlineThis thesis is divided in two parts.Part I presents the state of the art and elements of theoretical background.Chapter 1 summarizes the existing works in the domains adjacent to this thesis, namely knowledge graph construction, user-centric AI, relation extraction and Formal Concept Analysis.Chapter 2 presents the pre-existing theoretical background in Formal Concept Analysis used in the rest of the thesis.Part II presents

Read the paper · More papers on PaperTik