Improving Semantic Search in the German Legal Domain with Word Embeddings

Jörg Landthaler · mediaTUM (Technical University of Munich) · 2020

Die juristische Recherche ist ein wesentlicher Bestandteil juristischer Arbeit.Große juristische Textkorpora werden von Verlagen gepflegt und verändern sich mit der Zeit.Durch die Digitalisierung und die immer größer werdenden juristischen Informationsmengen gewinnt das Juristische Information Retrieval an Bedeutung.Synonymie ist ein wichtiger Aspekt der juristischen Sprache und des Juristischen Information Retrieval.Semantische Suche, insbesondere Query Expansion, kann dazu verwendet werden Synonymie zu adressieren.Daher unterhalten Verlage große juristische Thesauri.Word Embeddings ist eine Technologie, die Worte mit reellwertigen, dichten Vektoren repräsentiert, die semantische Aspekte, im Speziellen Synonymie codieren.Dies führt zu der Frage, ob und wie Word Embeddings dazu genutzt werden können, Query Expansion für das juristische Information Retrieval zu verbessern.Zuerst wird die Erweiterung deutscher juristischer Thesauri untersucht, in erster Linie die Erweiterung eines großen deutschsprachigen Steuerrechts-Thesaurus. Ein traditionelles und vier Word Embeddings basierte Verfahren werden qualitativ verglichen.Weiterhin werden die Word Embeddings Algorithmen GloVe, word2vec und FastText qualitativ und quantitativ verglichen.Zweitens wird eine implizite Form der Query Expansion untersucht, die auf dem WE-DF Vektorraum basiert.Der WE-DF Vektorraum stützt sich darauf, dass Word Embeddings Vektoren aufaddiert werden, um Textsegmente oder Dokumente zu codieren und benötigt keinen Thesaurus.Ein innovativer Anwendungsfall im deutschen Mietrecht wird untersucht.Anwälte wählen einen Textabschnitt in Mietverträgen aus und Kapitel aus Kommentaren werden für die natürlichsprachliche Suchanfrage vorgeschlagen (Textauswahl-Suche).Ein Ansatz, der Kapitel aus Kommentaren mit WE-DF codiert, ein Ansatz, der Kapitel aus Kommentaren als eine Menge von Sätzen, die mit WE-DF codiert werden, repräsentiert und das TF-IDF Vektorraum-Retrieval werden quantitativ verglichen.Die technischen Ansätze sowie die Suchmethoden Textauswahl-Suche und traditionelle Stichwortsuche werden mit einer Nutzerstudie evaluiert.Drittens wird ein eXplainable AI Ansatz, konkret eine Sensitivitätsanalyse, eingesetzt, um das WE-DF und das TF-IDF Vektorraum-Retrieval auf die Fähigkeit hin zu untersuchen, Kapitel aus Kommentaren zu repräsentieren.Erste empirische Studien und analytische Untersuchungen vergleichen die beiden Vektorraum-Retrieval Verfahren.Die qualitative Evaluation von mehr als 2000 vorgeschlagenen Begriffen zeigt, dass die Signale, die durch Word Embeddings Algorithmen codiert werden, zu viel Rauschen enthalten, um eine vollständige Automatisierung zu ermöglichen.Dennoch können Word Embeddings Algorithmen dazu einsetzt werden, um Domänen-Experten eine signifikante Anzahl an neuen Synonymen vorzuschlagen.Bis zu 50% richtige Vorschläge innerhalb der ersten zehn Vorschläge pro Synonym-Gruppe können identifiziert werden.Dieses positive Ergebnis kann nicht aus der Evaluation einer Thesaurus-Rekonstruktion abgeleitet werden.Word Embeddings Algorithmen führen zu signifikant besseren Ergebnissen, als traditionelle Verfahren.Das WE-DF Vektorraum-Retrieval ermöglicht eine implizite Query Expansion.Der Ansatz, der Kapitel aus Kommentaren als eine Menge von Sätzen repräsentiert, die mittels WE-DF codiert werden, erzielt unter den ersten Suchergebnissen bessere Ergebnisse als das traditionelle TF-IDF Vektorraum-Retrieval. Das WE-DF Vektorraum-Retrieval ist besonders dazu geeignet kleine Text-Abschnitte zu codieren.Die Ergebnisse der Nutzerstudie deuten darauf hin, dass die Textauswahl-Suche als eine komplementäre Suchmethode zur traditionellen Stichwortsuche einsetzt werden kann.

Read the paper · More papers on PaperTik