Profile-based selection of answer candidates for LogAnswer

Timo Eifler · 2012

In dieser Ausarbeitung beschreibe ich die Ergebnisse meiner Untersuchungen zur Erweiterung des LogAnswer-Systemsmit nutzerspezifischen Profilinformationen. LogAnswer ist ein naturlichsprachliches open-domain Frage-Antwort-System. Das heist: es beantwortet Fragen zu beliebigen Themen und liefert dabei konkrete (moglichst knappe und korrekte) Antworten zuruck. Das System wird im Rahmen eines Gemeinschaftsprojekts der Arbeitsgruppe fur kunstliche Intelligenz von Professor Ulrich Furbach an der Universitat Koblenz-Landau und der Arbeitsgruppe Intelligent Information and Communication Systems (IICS) von Professor Hermann Helbig an der Fernuniversitat Hagen entwickelt. Die Motivation meiner Arbeit war die Idee, dass der Prozess der Antwortfindung optimiert werden kann, wenn das Themengebiet, auf das die Frage abzielt, im Vorhinein bestimmt werden kann. Dazu versuchte ich im Rahmen meiner Arbeit die Interessensgebiete von Nutzern basierend auf Profilinformationen zu bestimmen. Das Semantic Desktop System NEPOMUK wurde verwendet um diese Profilinformationen zu erhalten. NEPOMUK wird verwendet um alle Daten, Dokumente und Informationen, die ein Nutzer auf seinem Rechner hat zu strukturieren. Dazu nutzt das System ein sogenanntes Personal Information Model (PIMO) in Form einer Ontologie. Diese Ontologie enthalt unter anderem eine Klasse Topic, welche die wichtigste Grundlage fur das Erstellen der in meiner Arbeit verwendeten Nutzerprofile bildete. Konkret wurde die RDF-Anfragesprache SPARQL verwendet, um eine Liste aller fur den Nutzer relevanten Themen aus der Ontologie zu filtern. Die zentrale Idee meiner Arbeit war es nun diese Profilinformationen zur Optimierung des Ranking von Antwortkandidaten einzusetzen. In LogAnswer werden zu jeder gestellten Frage bis zu 200 potentiell relevante Textstellen aus der deutschen Wikipedia extrahiert. Diese Textstellen werden auf Basis von Eigenschaften (wie z.B. lexikalische Ubereinstimmungen zwischen Frage und Textstelle) geordnet, da innerhalb des zur Verfugung stehenden Zeitlimits nicht alle Kandidaten bearbeitet werden konnen. Mein Ansatz verfolgte das Ziel, diesen Algorithmus durch Nutzerprofile so zu erweitern, dass Antwortkandidaten, welche fur den Benutzer relevante Informationen enthalten, hoher in der Rangfolge eingeordnet werden. Zur Umsetzung dieser Idee musste eine Methode gefunden werden, um zu bestimmen ob ein Antwortkandidat mit dem Profil ubereinstimmt. Da sich die in einer Textstelle enthaltenen Informationen in den meisten Fallen auf das ubergeordnete Thema des Artikels beziehen, ohne den Namen des Artikels explizit zu erwahnen, wurde in meiner Implementierung der Artikelname betrachtet, um zu ermitteln, zu welchem Themengebiet die Textstelle Informationen liefert. Als zusatzliches Hilfsmittel wurde auserdem die DBpedia-Ontologie eingesetzt, welche die Informationen der Wikipedia strukturiert im RDF Format enthalt. Mit Hilfe dieser Ontologie war es moglich, jeden Artikel in Kategorien einzuordnen, die dann mit den im Profil enthaltenen Stichworten verglichen wurden. Zur Untersuchung der Auswirkungen des Ansatzes auf das Ranking-Verfahren wurden mehrere Testlaufe mit je 200 Testfragen durchgefuhrt. Die erste Testmenge bestand aus zufallig ausgewahlten Fragen, die mit meinem eigenen Nutzerprofil getestet wurden. Dieser Testlauf lieferte kaum nutzbare Ergebnisse, da nur bei 29 der getesteten Fragen uberhaupt ein Antwortkandidat mit dem Profil in Verbindung gebracht werden konnte. Auserdem konnte eine potentielle Verbesserung der Ergebnisse nur bei einer dieser 29 Fragen festgestellt werden, was zu der Schlussfolgerung fuhrte, dass der Einsatz von Profildaten nicht fur Anwendungsfalle geeignet ist, in denen die Fragen keine Korrelation mit dem genutzten Profil aufweisen. Da die Grundannahme meiner Arbeit war, dass Nutzer in erster Linie Fragen zu den Interessensgebieten stellen, welche sich aus ihrem Profil ableiten lassen, sollten die weiteren Testlaufe genau diesen Fall beleuchten. Dazu wurden 200 Testfragen aus dem Bereich Sport ausgewahlt und mit einem Profil getestet, welches Stichworte zu unterschiedlichen Sportarten enthielt. Die Tests mit den Sportfragen waren wesentlich aussagekraftiger. Auch hier deuteten die Ergebnisse darauf hin, dass der Ansatz kein groses Potential zur Verbesserung des Rankings hat. Eine genauere Betrachtung einiger ausgewahlter Beispiele zeigte allerdings, dass die Integration von Profildaten fur bestimmte Anwendungsfalle, wie z.B. offene Fragen fur die es mehr als eine korrekte Antwort gibt, durchaus zu einer Verbesserung der Ergebnisse fuhren kann. Auserdem wurde festgestellt, dass viele der schlechten Ergebnisse auf Inkosistenzen in der DBpedia-Ontologie und grundsatzliche Probleme im Umgang mit Wissensbasen in naturlicher Sprache beruhen. Die Schlussfolgerung meiner Arbeit ist, dass der in dieser Arbeit vorgestellte Ansatz zur Integration von Profilinformationen fur den aktuellen Anwendungsfall von LogAnswer nicht geeignet ist, da vor allem Faktenwissen aus sehr unterschiedlichen Domanen abgefragt wird und offene Fragen nur einen geringen Anteil ausmachen.

Read the paper · More papers on PaperTik