Novel feature selection methods for high dimensional data

Verónica Bolón Canedo · 2014

La seleccion de caracteristicas se define como el proceso de detectar las caracteristicas relevantes y descartar las irrelevantes, con el objetivo de obtener un subconjunto de caracteristicas mas pequeno que describa adecuadamente el problema dado con una degradacion minima o incluso con una mejora del rendimiento. Con la llegada de los conjuntos de alta dimension -tanto en muestras como en caracteristicas-, se ha vuelto indispensable la identificacion adecuada de las caracteristicas relevantes en escenarios del mundo real. En este contexto, los diferentes metodos disponibles se encuentran con un nuevo reto en cuanto a aplicabilidad y escalabilidad. Ademas, es necesario desarrollar nuevos metodos que tengan en cuenta estas particularidades de la alta dimension. Esta tesis esta dedicada a la investigacion en seleccion de caracteristicas y a su aplicacion a datos reales de alta dimension. La primera parte de este trabajo trata del analisis de los metodos de seleccion de caracteristicas existentes, para comprobar su idoneidad frente a diferentes retos y para poder proporcionar nuevos resultados a los investigadores de seleccion de caracteristicas. Para esto, se han aplicado las tecnicas mas populares a problemas reales, con el objetivo de obtener no solo mejoras en rendimiento sino tambien para permitir su aplicacion en tiempo real. Ademas de la eficiencia, la escalabilidad tambien es un aspecto critico en aplicaciones de gran escala. La eficacia de los metodos de seleccion de caracteristicas puede verse significativamente degradada, si no totalmente inaplicable, cuando el tamano de los datos se incrementa continuamente. Por este motivo, la escalabilidad de los metodos de seleccion de caracteristicas tambien debe ser analizada. Tras llevar a cabo un analisis en profundidad de los metodos de seleccion de caracteristicas existentes, la segunda parte de esta tesis se centra en el desarrollo de nuevas tecnicas. Debido a que la mayoria de metodos de seleccion existentes necesitan que los datos sean discretos, la primera aproximacion propuesta consiste en la combinacion de un discretizador, un filtro y un clasificador, obteniendo resultados prometedores en escenarios diferentes. En un intento de introducir diversidad, la segunda propuesta trata de usar un conjunto de filtros en lugar de uno solo, con el objetivo de liberar al usuario de tener que decidir que tecnica es la mas adecuada para un problema dado. La tercera tecnica propuesta en esta tesis no solo considera la relevancia de las caracteristicas sino tambien su coste asociado -economico o en cuanto a tiempo de ejecucion-, por lo que se presenta una metodologia general para seleccion de caracteristicas basada en coste. Por ultimo, se proponen varias estrategias para distribuir y paralelizar la seleccion de caracteristicas, ya que transformar un problema de gran escala en varios problemas de pequena escala puede llevar a mejoras en el tiempo de procesado y, en algunas ocasiones, en precision de clasificacion.

Read the paper · More papers on PaperTik