SQL based frequent pattern mining
Xuequn Shang · Digitalen Hochschulbibliothek Sachsen-Anhalt (Universitäts- und Landesbibliothek Sachsen-Anhalt) · 2005
Operationen zur Kandidatengenerierung und deren -test eine unzureichende Performanz auf, insbesondere bei der Suche nach besonders aussagekräftigen und/oder langen Mustern.Hierfür wurde im hier beschriebenen Dissertationsprojekt eine Klasse von SQL-basierten Methoden zum schrittweisen Finden und Verfeinern von Mustern entwickelt.Die Gemeinsamkeit dieser Methoden besteht im Teile und Herrsche-Ansatz zur Zerlegung von Mining-Aufgaben und in der Anwendung einer Musterverfeinungsmethode zur Vermeidung des kombinatorischen Effekts, der für die Kandidatengenerierung ein typisches Problem darstellt.Apriori-basierte Algorithmen erforderen bei der Verwendung von SQL entweder mehrere Scans über die Datenbank oder aufwändige Verbundoperationen.Demgegenüber vermeiden die hier vorgestellten SQL-basierten Algorithmen mehrere Durchläufe über die Ausgangstabellen als vi auch die Berechnung komplexer Verbunde zwischen Tabellen.Eine umfassende Untersuchung der Performanz wurde unter Verwendung eines DBMS (IBM DB2 UDB EEE V8) durchgeführt und die Ergebnisse herkömmlicher Apriori-basierter Ansätze wurden mit denen der in dieser Arbeit vorgestellten Methoden verglichen.Empirische Ergebnisse zeigen, dass die vorgestellten Algorithmen zu einer effizienten Berechnung führen.Darüber hinaus unterstützen die meisten Datenbankmanagementsysteme heutzutage die Parallelisierung, deren Eignung zur Unterstützung des Frequent Pattern Mining im Rahmen dieser Arbeit untersucht wurde.