Preprocessing algorithmus oriented towards supervised classification of high dimensionality databases: applications to multimedia data mining.
Pablo Bermejo López · Dialnet (Universidad de la Rioja) · 2012
El tema central de esta Tesis, dividida en 4 partes, es el preprocesamiento supervisado de bases de datos de alta dimensionalidad. La primera parte presenta una introduccion a la Clasificacion Supervisada y la Seleccion Supervisada de Atributos; explicando asi los conocimientos basicos necesarios para seguir las propuestas y experimentos en el resto de la Tesis. Los Capitulos 3 al 5 de la segunda parte se centra en la mejora del algoritmo de seleccion de variables Incremental Wrapper Subset Selection (IWSS), mediante: (1) mejorar el criterio de seleccion de una variable; (2) anadir un metodo de reemplazo de variables seleccionadas y no seleccionadas para capturar (in)dependencias; (3) reduccion drastico del tiempo de ejecucion de IWSS embebiendo el clasificador Naive Bayes y criterio de parada adaptativo; (4) reduccion drastica del numero de evaluaciones necesarias mediante la opcion de re-rankear el ranking sobre el que se ejecuta IWSS para capturar (in)dependencias entre variables y terminar pronto el algoritmo; y (5) introduccion de aleatoriedad mediante un algoritmo GRASP con IWSS para ampliar el espacio de busqueda. Los experimentos se realizan con bases de datos de microarrays y texto. El Capitulo 6 presenta un metodo novedoso de balancea mediante metodos de muestreo de instancias basados en distribuciones, con aplicacion a clasificacion de correo-e en carpetas. La tercera parte de esta Tesis esta compuesta por 2 capitulos en cuyos experimentos se utilizan bases de datos de video. El Capitulo 7 presenta una introduccion a las variables mas comunes en la representacion de documentos multimedia; y ademas realiza una comparacion entre diferentes tipos de representacion. El Capitulo 8 realiza experimentos para averiguar si el contexto de un usuario realizando una tarea de recuperacion de la informacion (e.g. busqueda on-line de documentos) afecta a la calidad de los resultados. Los experimentos sugieren que las bases de datos pueden ser preprocesadas mediante una seleccion de instancias basada en el contexto en que dichas instancias fueron creadas. Finalmente, la ultima parte de la tesis presenta las principales conclusiones obtenidas.