Web Usage Mining: Contributions to Intersites Logs Preprocessing and Sequential Pattern Extraction with Low Support

Doru Tanasa · HAL (Le Centre pour la Communication Scientifique Directe) · 2005

Le Web Usage Mining (WUM), domaine de recherche assez récent, correspond au processus d extraction des connaissances à partir des données (ECD) appliquées aux données d usage sur le Web. Il comporte trois étapes principales : le prétraitement des données, la découverte des schémas et l analyse des résultats. La quantité des données d usage à analyser ainsi que leur faible qualité (en particulier l absence de structuration) sont les principaux problèmes en WUM. Les algorithmes classiques de fouille de données appliquées sur ces données donnent généralement des résultats décevants en termes de pratiques des internautes. Dans cette thèse, nous apportons deux contributions importantes pour un processus WUM, implémentées dans notre boîte à outils Axislogminer. D abord, nous proposons une méthodologie générale de prétraitement des logs Web dont l originalité consiste dans le fait qu elle prend en compte l aspect multi-sites du WUM. Nous proposons dans notre méthodologie quatre étapes distinctes : la fusion des fichiers logs, le nettoyage, la structuration et l agrégation des données. Notre deuxième contribution vise à la découverte à partir d un fichier log prétraité de grande taille, des comportements minoritaires correspondant à des motifs séquentiels de très faible support. Pour cela, nous proposons une méthodologie générale visant à diviser le fichier log prétraité en sous-logs, se déclinant selon trois approches d extraction de motifs séquentiels au support faible (séquentielle, itérative et hiérarchique). Celles-ci ont été implémentées dans des méthodes concrètes hybrides mettant en jeu des algorithmes de classification et d extraction de motifs séquentiels.

Read the paper · More papers on PaperTik