Unsupervised Induction of Domain Dependency Graphs - Extracting, Understanding and Visualizing Domain Knowledge
Sarah N. Kohail · 2019
The unstructured nature of text documents makes the task of processing and understanding it by machines very challenging, and transforming it into structured representation has become a pressing. Classical Bag-of-Words-based Vector Space Model (BoW-based VSM) represents documents as independent terms and only considers the document as a histogram of word occurrences, ignoring structural and semantic aspects of textual contents. This dissertation explores the utility of graph-based text representations as an alternative to classical text representation models. Specifically, we propose a new data-driven graph-theoretic approach to representing text by means of graphs, called Domain Dependency Graphs (DDGs). DDGs integrate the power of graph representation, as a way to preserve the dependency structure of a text, with topic modeling, as a way to uncover the hidden topical semantic structure of a text. In summary, DDGs generation process goes as follows: using topic modeling, we extract dominant topics from a corpus of documents. Then, source-side dependency structures of documents per topic are modeled as one coherent DDG, which maintains the inter-topic cohesiveness together with the structural aspect of a text. Later, an extra level of term and dependency weighting approach is applied to ensure the extraction of highly domain-specific words and relations. Our approach is completely unsupervised and needs no labeled training data or previous knowledge about the domains. In an effort to provide further understanding of the extracted DDGs, we develop DDGviz, an interactive open-source web-based visualization tool, which enables users to filter, analyze, search and easily interact with generated DDGs by adjusting various parameters and configurations. To demonstrate the effectiveness of the generated DDGs, we perform extrinsic evaluation by integrating several DDGs-based features, and graph mining and alignment approaches to improving the performance of relevant Natural Language Processing (NLP) tasks, namely Aspect-based Sentiment Analysis (ABSA) and Semantic Textual Similarity (STS), as follows: (1) We explore the effectiveness of DDGs-based features, like DDGs top domain words and DDGs identified aspects, in addition to distributional semantics features, for improving the performance of supervised models for different aspect-based sentiment analysis subtasks. We also propose a novel unsupervised graph-rule mining approach, which incorporates high level linguistic structural information to accurately identify the most compelling aspects of different entities (aspect identification) and extract opinion related expressions (OTE-sentiment extraction) from unstructured user-generated reviews. (2) We provide an unsupervised STS solution to finding similarities between two texts based on DDGs alignment. We introduce an approximate sub-graph alignment approach to find a dependency sub-graph in the candidate text dependency graph that is similar to a given query text dependency graph, allowing for node gaps and mismatches, where a certain word in one dependency graph cannot be mapped to any word in the query text graph, as well as graph structural differences. We also examine the impact of using DDGs similarity-based and coverage-based features to improve the identification and prediction of STS supervised models. Experiments on different benchmark datasets for different subtasks revealed that incorporating DDGs-based features show superior results compared to state-of-the-art approaches. Die Abwesenheit von Struktur in Texten fuhrt bei der Verarbeitung und beim Verstehen durch Maschinen zu besonderen Herausforderungen und die Transformation von Text in eine strukturierte Reprasentation verlangt dringend nach einer Losung. Klassische auf Bag-of-Words-basierende Vector Space Modelle (BoW-based VSM) betrachten ein Dokument lediglich als Histogramm von Worthaufigkeiten,was die strukturellen und semantischen Eigenschaften des Textinhalts ignoriert. Diese Dissertation erforscht den Nutzen von graphbasierten Textreprasentationen als eine Alternative zu klassischen Textreprasentationsmodellen. Im Besonderen stellen wir einen neuen datengetriebenen graphentheoretischen Ansatz zur Textreprasentation durch Graphen mit dem Namen Domain Dependency Graphs (DDGs) vor. DDGs vereinen die Machtigkeit der Graphenreprasentation, als Moglichkeit zum Erhalt der Abhangigkeitsstruktur eines Texts, mit Topic Modeling, als Moglichkeit versteckte thematische Strukturen in Texten aufzudecken. Der Generierungsprozess von DDGs kann folgendermasen zusammengefasst werden: Unter Verwendung von Topic Modeling extrahieren wir dominante Themen innerhalb eines Dokumentenkorpus. Dann werden Abhangigkeitsstrukturen (Dependenzen) der Dokumente fur jedes Thema als koharenter DDG modelliert, was den inter-thematischen Zusammenhalt mit der strukturellen Komponente des Texts erhalt. Spater wird auf einer zusatzlichen Ebene ein Vorgehen zur Ausdrucks- und Abhangigkeitsgewichtung angewendet, um die Extraktion von hoch domanenspezifischen Begriffen und Beziehungen sicherzustellen. Unser Ansatz ist komplett unuberwacht und benotigt keine gekennzeichneten Trainingsdaten oder vorheriges Wissen uber die Domane. In dem Bestreben weiteres Verstandnis fur die extrahierten DDGs zu schaffen, haben wir DDGviz entwickelt, welches ein open-source Web-basiertes Visualisierungswerkzeug ist, das einem Nutzer eine einfache Interaktion sowie mit Filtern, Analysieren und Durchsuchen von generierten DDGs durch Anpassung von verschiedenen Parametern und Konfigurationen erlaubt. Zur Demonstration der Effektivitat der generierten DDGs fuhren wir eine extrinsische Evaluation unter Integration von verschiedenen DDG-basierenden Merkmalen, sowie Graph Mining und Abgleichansatzen durch, um die Leistung bei relevanten sprachtechnologischen Aufgaben, namentlich Aspect-based Sentiment Analysis (ABSA) und Semantic Textual Similarity (STS), wie folgt zu verbessern: (1) Wir erforschen die Effektivitat von DDG-basierten Merkmalen wie die von DDGs identifizierten Top-Domanenbegriffe und Aspekte, zusatzlich zu Merkmalen der distributionellen Semantik zur Verbesserung der Leistung von uberwachten Modellen verschiedener Aspekt-basierter Teilaufgaben der Stimmungsanalyse (Sentiment Analysis). Wir schlagen zudem ein neuartiges unuberwachtes Graph-Rule Mining Verfahren vor, welches linguistische Strukturinformation zur genauen Identifikation der uberzeugendsten Aspekte unterschiedlicher Entitaten (Aspect Identification) sowie Opinion Target Expressions (OTE-sentiment Extraction) aus unstrukturierten nutzergenerierten Rezensionen beinhaltet. (2) Wir schlagen eine unuberwachte STS Losung zum Aufspuren von Ahnlichkeiten zwischen zwei Texten basierend auf DDG-Abgleichen vor. Wir fuhren ein Verfahren zum approximativen Abgleich von Subgraphen ein, um einen Abhangigkeitsteilgraph im Abhangigkeitsgraphen des Kandidatentexts zu finden, welcher ahnlich zu einem gegebenen Abhangigkeitsgraphen eines Abfragetexts ist. Dies erlaubt das Auftreten von Knotenlucken und Nichtubereinstimmungen, bei denen ein bestimmtes Wort in einem Abhangigkeitsgraphen nicht auf ein Wort im Graphen des Abfragetexts zugeordnet werden kann, als auch Strukturunterschiede in den Graphen. Wir prufen zudem den Einfluss der Verwendung von ahnlichkeitsbasierten und abdeckungsbasierten DDGMerkmalen zur Verbesserung der Identifikation und Vorhersage von uberwachten STS Modellen. Experimente auf unterschiedlichen Benchmark-Datensatzen fur unterschiedliche Teilaufgaben zeigten, dass die Integration von DDG-basierten Merkmalen zu besseren Ergebnissen im Vergleich zu zu aktuellen Ansatzen fuhrt.