Integrating semantic web and unstructured information processing environments : a visual rule-based approach
Wassim El-Kass · 2018
Les informations non-structurees referent principalement au texte, mais aussi a toutes les informations stockees sans une structure de donnees predefinie. Des progres significatifs ont ete realises dans le Traitement automatique du langage naturel (TALN), avec des annotations syntaxique et toponymique tres fiables utilisant l’etiquetage morpho-syntaxique (Part of Speech (POS) tagging), la segmentation des phrases (Noun Phrase (NP) chunking), et la reconnaissance d'entites nommees (Named-Entity Recognition, NER). Cependant, l'annotation semantique reste une tâche difficile, dont la precision et le rappel varient considerablement selon les types de documents et domaines d'application. Tandis que les textes simples tels que des messages electroniques dans un seul domaine peuvent etre analyses avec des resultats coherents, des documents professionnels et scientifiques de taille similaire, comme les nouvelles et les resumes, presentent trop de complexite avec divers vocabulaires et significations ambigues a travers des phrases et des sections du document. Les principales difficultes restent la relation des concepts entre eux sous forme de graphiques d'annotation, et leur combinaison pour un classement dans une hierarchie de classes semantiquement valide et exhaustive. Dans cette these, nous demontrons comment utiliser les technologies du web semantique, en particulier les ontologies et bases de donnees de graphes, pour aider a ameliorer la qualite (F-score) de ces tâches d'annotation et de classification. Nous integrons une ontologie formelle avec une plate-forme de TALN standard, la testons sur un corpus de la recherche publique, et rapportons des F-scores superieurs aux algorithmes d'apprentissage machine anterieurs. Nous developpons et testons une plate-forme innovante, soit une Architecture adaptative a base de regles pour l’extraction de connaissances (Adaptive Rules-Driven Architecture for Knowledge Extraction, ARDAKE). Notre logiciel integre la norme Architecture de gestion de l’information non-structuree (Unstructured Information Management Architecture, UIMA) avec une base de donnees graphique standard pour stocker nos ontologies. Nous developpons des extensions au langage de regles UIMA Ruta pour invoquer et verifier les rapports entre classes de l'ontologie. D’autres extensions comprennent le calcul de mesures complementaire utiles pour integrer les regles de correspondance (matching) entre mots et classes, soient conditionnelles, statistiques, et basees sur les distances semantiques. Nous developpons egalement un nouvel algorithme iteratif des n-grammes afin de combiner les regles de correspondance et d’optimiser les F-scores et l’aire sous les courbes de Caracteristique de fonctionnement du recepteur (Receiver Operating Characteristic, ROC). Nous proposons un nouveau style graphique circulaire (pie-chart) pour faciliter la visualisation de l'evaluation de la performance d'annotation. Ces composants sont integres dans une interface graphique permettant aux experts du domaine de regles de composer visuellement des ensembles de regles, dans des hierarchies de complexite variable, de scorer et comparer leur performance relative, et enfin les ameliorer en integrant des sources d'ontologies supplementaires. Notre plate-forme est testee sur un cas d'utilisation particulier dans les sciences de la sante : une methode d'analyse de la litterature medicale selon la population, l’intervention, le controle, et les resultats (Population, Intervention, Control, and Outcome, PICO). Nous montrons que notre plate-forme peut efficacement et automatiquement produire des ensembles de regles parcimonieux, avec des F-scores plus eleves sur les classes P et I que les auteurs anterieurs utilisant des algorithmes d'apprentissage machine.