Querying and mining heterogeneous spatial, social, and temporal data

Maximilian Franzke · Electronic Theses of LMU Munich (Ludwig-Maximilians-Universität München) · 2019

Zusammenfassung Während sich die allermeisten Aspekte des modernen Lebens durch die fortschreitende Digitalisierung verändern, vergrößert sich damit die Menge an Daten, die gemessen, gespeichert und verarbeitet wird, signifikant.Einerseits vergrößert sich die Datenmenge, andererseits erhöht sich auch die Komplexität der Daten selbst: Immer mehr Teilnehmer in sozialen und kollaborativen Netzen sorgen dafür, dass sich Daten schneller als je zuvor verändern.Obwohl unterschiedliche Arten von Geräten zwar Messungen der gleichen Datenmetrik vornehmen, tun sie dies aus ganz verschiedenen Gründen und in unterschiedlichen Kontexten -und eine Unzahl an Programmen und Apps kombinieren verschiedene Datenmetriken, um ihren Nutzern einen Mehrwert zu bieten.Dadurch haben Daten keine konsistente "Form" mehr, sondern existieren in verschiedenen Qualitätsstufen durch unterschiedliche Repräsentationen auf verteilten, inhomogenen Datenbanken und werden für jede Anfrage anders verarbeitet -auch während sie sich permanent verändern.Diese Dissertation beschäftigt sich damit, wie man den Herausforderungen begegnen kann, die diese neue Art von Daten mit sich bringt: Wenn ein einzelnes Objekt in verschiedenen Domänen gemessen wird, existiert es nicht länger nur als einzelner Punkt in einem Datenraum, sondern es kann Repräsentationen in mehreren Räumen haben.Solch eine Multi-Repräsentation von Objekten erfordert neue Maßsysteme, Konzepte, Indexstrukturen und Algorithmen für Speicherung, Verwaltung und Anfragen.Während sich die Komplexität der Daten erhöht, explodieren zugleich die Kosten ihrer Verarbeitung: Die Beantwortung von Anfragen auf große heterogene Datenmengen sollte daher individuelle Eigenschaften der Daten berücksichtigen; und Data Mining hilft dabei, noch komplexere Abhängigkeiten und Beziehungen zu entdecken, was den Weg für weitere Anwendungen ebnet.Im Rahmen dieser Dissertation werden mehrere neue Methoden und Lösungen zur Behandlung solcher multi-repräsentierten Objekte vorgestellt.Jeder Ansatz konzentriert sich dabei auf unterschiedliche Aspekte und ermöglicht effiziente Lösungen für diese Szenarien.Eine neue Indexstruktur für generische, multi-metrische Daten ermöglicht es, dynamisch gewichtete Ähnlichkeitsanfragen effizient zu beantworten und schlägt bisherige Vergleichsverfahren. Ein neuer Ansatz zur Beantwortung von Skyline-Anfragen im geosozialen Datenraum berücksichtigt domänenspezifische Eigenschaften und ermöglicht so eine effiziente Anfragebearbeitung, indem Berechnungen in der jeweils geeignetsten Metrik durchgeführt werden.Da soziale Daten neben der räumlichen, auch mit der zeitlichen Domäne verknüpft sein können, fokussiert sich eine vorgestellte Data Mining-Methode darauf, in einem sozialen Netzwerk einflussreiche Personen (sog.Influencer) zu finden, indem sie Interventionsanalysen auf temporal-sozialen Graphen durchführt.Außerdem werden in dieser Dissertation Methoden zur Anfragebearbeitung auf unsicheren räumlichzeitlichen Daten sowie nutzergenerierten ("Crowd-Sourcing") Graph-Daten vorgestellt.

Read the paper · More papers on PaperTik