Document classification models based on bayesian networks

Romero López, Alfonso Eduardo · Dialnet (Universidad de la Rioja) · 2010

La primera contribucion de esta tesis es presentar nuevos metodos de Clasificacion Documental basados en puertas OR ruidosas como una contrapartida discriminativa al clasificador Naive Bayes multinomial, El clasificador Naive Bayes se usa bastante en las comunidades de Aprendizaje Automatico y en la de Clasificacion Documental, y representa un buen punto inicial para trabajar con modelos probabilisticos. Para mejorar algunas limitaciones del modelo, tambien se presenta un procedimiento de poda ad hoc que refina el proceso de aprendizaje de nuestro modelo de puerta OR. Afirmamos que el modelo de puerta OR propuestomantiene la simplicidad del Naive Bayes, incrementando su poder de discriminacion. La segunda contribucion de esta tesis es la introduccion del problema de indexacion basada en un tesauro. Este problema se ha tratado anteriormente en la literatura, pero o bien como un problema de clasificacion supervisada (sin usar la jerarquia o los metadatos), o como un problema de indexacion no supervisada. Presentaremos una formalizacion de un tesauro, independiente del modelo de clasificacion que se describe posteriormente, y apropiado para muchos de los tesauros usados en el mundo. Junto a esta formalizacion, presentaremos el problema de clasificacion en tesauros propiamente dicho, y propondremos dos soluciones: una usando informacion de entrenamiento y otra sin usarla, ambas construidas usando un modelo de red bayesiana del tesauro y de su informacion relacionada. De hecho, el modelo con informacion de entrenamiento se muestra como una extension del no supervisado, haciendo uso del clasificador puerta OR anteriormente presentado. Trataremos de probar que un modelo probabilistico de las relaciones entre las categorias y los metadatos que tiene el tesauro, junto con la informacion de entrenamiento, puede tener un poder de clasificacion comparable o superior al modelo que representa el estado del arte en Clasificacion Documental (la Maquina de Vectores Soporte Lineal). Nuestra contribucion finaliza con la proposicion de varios modelos para problemas de clasificacion estructurada. Primeramente realizaremos transformaciones a documentos XML para convertirlos en texto plano y poder aplicar el clasificador puerta OR presentado. Por otra parte, mostraremos dos soluciones al problema de clasificacion basada en enlaces; uno para el caso multiclase (donde un documento se etiqueta con una de entre varias categorias) y otro para el modelo multietiqueta (donde el numero de categorias asociado a cada documento es libre). Ambas propuestas se basan en redes bayesianas aprendidas directamente de las relaciones entre las categorias presentes en los datos de entrenamiento, y hacen uso de un clasificador probabilistico para el contenido (como, por ejemplo, el Naive Bayes). De este modo, nuestros modelos pueden ser vistos como una extension de un modelo probabilistico clasico para el caso de clasificacion basada en enlaces.

Read the paper · More papers on PaperTik