Advances on supervised and unsupervised learning of Bayesian network models. Application to population genetics

Guzmán Santafé Rodrigo · Dialnet (Universidad de la Rioja) · 2008

La clasificacion supervisada y el clustering de datos son dos disciplinas fundamentales en los campos conocidos como mineria de datos y aprendizaje automatico, En ambas disciplinas los modelos graficos probabilisticos en general, y mas en concreto las redes Bayesianas, son paradigmas que gozan de gran popularidad debido a la transparencia que ofrecen a la hora de representar la incertidumbre y de modelar las relaciones de dependencia/independencia subyacentes a los datos asi como debido a sus fuertes fundamentos teoricos basados en la teoria de la probabilidad. Esta tesis pretende contribuir al estado del arte tanto de la clasificacion supervisada como del clustering de datos con la propuesta de nuevos algoritmos de aprendizaje de redes Bayesianas. En el caso de la clasificacion supervisada, los desarrollos propuestos se basan en el aprendizaje discriminativo de clasificadores Bayesianos. Este tipo de aprendizaje es, en principio, una forma mas natural de aprender modelos para clasificacion ya que trata directamente e modelar la relacion de las variables predoctoras con la variable a predecir o variable clase. A lo largo de la tesis se discute sobre las mejoras que el aprendizaje discriminativo puede aportar sobre tradicionales metodos generativos de aprendizaje de redes Bayesianas y se proponen nuevos algoritmos para el aprendizaje discriminativo de parametros y estructura para dichos modelos. Por otra parte, los desarrollos propuestos relativos al clustering de datos estan centrados en lo que se conoce como promediado Bayesiano de redes Bayesianas para clustering son intratables. En la tesis se proponen nuevos algoritmos que permiten, de forma eficiente, aproximar el promediado de modelos Naike Bayes y TAN, respectivamente, para clustering. Estos algoritmos propuestos son evaluados empiricamente para probar su funcionalidad y posible utilidad. Dicha utilidad queda comprobada con la aplicacion de uno de los metodos propuestos para resolver el problema de la inferencia de la estructura de una poblacion en base a polimorfismos de ADN, el cual es un problema muy habitual en el mundo de la genetica de poblaciones.

Read the paper · More papers on PaperTik