Aspect-based Document Similarity for Literature Recommender Systems
Malte Ostendorff · 2023
Literaturempfehlungssysteme unterstützen den Leser relevanten Dokumente zu finden. Dabei nutzen inhaltsbasierte Systeme sog. Dokumentenähnlichkeitsmaße. Die alleinige Unterscheidung zwischen ähnlichen und unähnlichen Dokumenten vernachlässigt jedoch die vielen Aspekte, die Dokumente ähnlich machen. So können beispielsweise wissenschaftliche Artikel ähnlich in ihrer Methodik aber unterschiedlich in dem behandelten Problem sein. Heutige Dokumentenähnlichkeitsmaße sind aspektfrei, d.h. sie unterscheiden nicht zwischen Aspekten des Dokumentinhalts. Um dieses Problem zu adressieren, schlägt diese Arbeit eine aspektbasierte Dokumentenähnlichkeit vor. Die Einbeziehung von Aspekten ermöglicht Empfehlungen für bestimmte Aspekte des Dokumentinhalts. Diese Arbeit leistet drei Forschungsbeiträge: Erstens werden Dokumentrepräsentationen und Ähnlichkeitsmaße evaluiert und es wird gezeigt, dass das Fehlen von Aspektinformationen Empfehlungen beeinträchtigt. Zweitens wird eine Methode zur Dokumentenrepräsentation entwickelt, die den Stand der Technik verbessert. Drittens werden zwei Ansätze zur aspektbasierten Dokumentenähnlichkeit entwickelt, die die genannten Probleme adressieren. Die Arbeit evaluiert Dokumentenähnlichkeitsmaße, die Graph- bzw. Textinformationen verwenden. Die Evaluationen zeigen, dass die Nutzerzufriedenheit zwischen den beiden Informationsquellen zwar vergleichbar ist, die Nutzer aber die Empfehlungen aus diesen Quellen als unterschiedlich wahrnehmen. Daher beeinflusst die Wahl der Ähnlichkeitsmaße die generierten Empfehlungen, d.h. sie adressieren implizit unterschiedliche Aspekte. Außerdem entwickelt die Arbeit eine Repräsentationsmethode für wissenschaftliche Artikel. Die Methode mit dem Namen SciNCL nutzt Contrastive Learning und Embeddings des Zitationsgraphen, um einen Dokumentenkodierer zu trainieren. SciNCL verbessert den Stand der Technik und ist sowohl für aspektfreie als auch aspektbasierte Dokumentenähnlichkeit anwendbar. Anschließend wird zunächst ein aspektbasiertes Dokumentenähnlichkeitsmaß entwickelt, das auf einem paarweisen Mehrklassen-Klassifikationsansatz beruht. Im Gegensatz zur aspektfreien Ähnlichkeit, bei der es sich um eine paarweise binäre Dokumentenklassifikation handelt, ermöglicht die Mehrklassenklassifikation die Messung der Ähnlichkeit für einen bestimmten Aspekt. Der Klassifikationsansatz wird für Wikipedia und wissenschaftliche Artikel implementiert und evaluiert. Die Arbeit implementiert auch einen zweiten Ansatz mit verbesserter Effizienz, der auf speziellen Dokumentrepräsentationen basiert. Die aspektbasierte Ähnlichkeit wird als Vektorähnlichkeitsproblem in aspektspezifischen Embedding Spaces formuliert, dadurch werden die Aspektinformationen nur einmal pro Dokument und Aspekt kodiert. Weitere Evaluationen zeigen, dass aspektfreie Repräsentationen eine implizite Tendenz zu einem der Aspekte aufweisen, was das Problem der fehlenden Aspektinformationen bestätigt. Die spezialisierten Dokumentrepräsentationen machen diese Tendenzen explizit und somit kontrollierbar. Schließlich wird die Anwendbarkeit der aspektbasierten Dokumentenähnlichkeit anhand eines prototypischen Empfehlungssystems für wissenschaftliche Artikel demonstriert. Der Prototyp bietet nicht nur vielfältige Empfehlungen zu unterschiedlichen Aspekten, sondern auch auf bestimmte Aspekte zugeschnittene Empfehlungen.