An improved fuzzy system for representing web pages in clustering tasks
Alberto Pérez García-Plaza · 2013
AN IMPROVED FUZZY SYSTEM FOR REPRESENTING WEB PAGES IN CLUSTERING TAKS (UN SISTEMA BORROSO MEJORADO PARA LA REPRESENTACION DE PAGINAS WEB EN PROBLEMAS DE CLUSTERING) RESUMEN: Mantener la informacion organizada es un factor clave para facilitar el acceso a la misma. Aunque la informacion que necesitamos a veces este disponible en la Web, esta informacion no es util si no somos capaces de acceder a ella. Con este objetivo, es cada vez mas habitual el uso de tecnicas automaticas para agrupar documentos. En esta tesis estamos interesados en el clustering de documentos, que consiste basicamente en agrupar dichos documentos en base a la similitud de sus contenidos. A este respecto, la representacion de los documentos juega un papel fundamental en el clustering de paginas web y constituye el foco principal de la investigacion llevada a cabo en esta tesis. El lenguaje HTML es la alternativa mas comun para escribir paginas web. Este lenguaje contiene informacion explicita (etiquetas, en este caso) sobre su representacion visual, la tipografia del texto o incluso su estructura, entre otras cosas. Es tambien un formato muy comun en Internet. El objetivo principal de esta tesis es realizar un estudio en profundidad con la intencion de aprovechar al maximo un modelo borroso de representacion de documentos HTML para problemas de clustering. Nuestro estudio se centra en la idea de descubrir si alguna parte del sistema puede ser explotada de una manera diferente que nos permita mejorar los resultados de clustering. Comenzamos nuestro trabajo analizando las partes del sistema que son susceptibles de mejora y estudiamos diferentes alternativas para realizar dichas mejoras. Por lo tanto, no proponemos un modelo de representacion de documentos partiendo de cero, sino que lo construimos tratando de entender, en cada paso, sus diferentes aspectos. Para la evaluacion de nuestros resultados y la comparacion de las diferentes propuestas de representacion, utilizamos distintas colecciones de paginas web de referencia que fueron creadas previamente para ser utilizadas como gold standards. El clustering se realiza por medio de algoritmos del estado del arte y nuestras propuestas son validadas en entornos de clustering plano y jerarquico. Finalmente, tambien tratamos de comprobar la utilidad de nuestras aproximaciones para la representacion de paginas web escritas en dos idiomas, Ingles y Espanol.