Machine Learning for Disease Outbreak Detection Using Probabilistic Models

Nastaran Jafarpour Khameneh · 2014

RESUME L’expansion de maladies connues et l’emergence de nouvelles maladies ont affecte la vie de nombreuses personnes et ont eu des consequences economiques importantes. L’Ebola n’est que le dernier des exemples recents. La detection precoce d’infections epidemiologiques s’avere donc un enjeu de taille. Dans le secteur de la surveillance syndromique, nous avons assiste recemment a une proliferation d’algorithmes de detection d’epidemies. Leur performance peut varier entre eux et selon differents parametres de configuration, de sorte que l’efficacite d’un systeme de surveillance epidemiologique s’en trouve d’autant affecte. Pourtant, on ne possede que peu d’evaluations fiables de la performance de ces algorithmes sous differentes conditions et pour differents types d’epidemie. Les evaluations existantes sont basees sur des cas uniques et les donnees ne sont pas du domaine public. Il est donc difficile de comparer ces algorithmes entre eux et difficile de juger de la generalisation des resultats. Par consequent, nous ne sommes pas en mesure de determiner quel d’algorithme devrait etre applique dans quelles circonstances. Cette these poursuit trois objectifs generaux : (1) etablir la relation entre la performance des algorithmes de detection d’epidemies et le type et la severite de ces epidemies, (2) ameliorer les predictions d’epidemies par la combinaison d’algorithmes et (3) fournir une methode d’analyse des epidemies qui englobe une perspective de couts afin de minimiser l’impact economique des erreurs du type faux positifs et faux negatifs. L’approche generale de notre etude repose sur l’utilisation de donnees de simulation d’epidemies dont le vecteur de transmission est un reseau d’aqueducs. Les donnees sont obtenues de la plateforme de simulation SnAP du Department of Epidemiology and Biostatistics Surveillance Lab de l’universite McGill. Cette approche nous permet de creer les differentes conditions de types et d’intensites d’epidemiologie necessaires a l’analyse de la performance des algorithmes de detection. Le premier objectif porte sur l’influence des differents types et differentes intensites d’epidemiologie sur la performance des algorithmes. Elle est modelisee a l’aide d’un modele base sur un reseau bayesien. Ce modele predit avec succes la variation de performance observee dans les donnees. De plus, l’utilisation d’un reseau bayesien permet de quantifier l’influence de chaque variable et releve aussi le role que jouent d’autres parametres qui etaient jusqu’ici ignores dans les travaux anterieurs, a savoir le seuil de detection et l’importance de tenir compte de recurrences hebdomadaires. Le second objectif vise a exploiter les resultats autour du premier objectif et de combiner les algorithmes pour optimiser la performance en fonction des facteurs d’influence. Les resultats des algorithmes sont combines a l’aide de la methode de Mixture hierarchique d’expert (Hierarchical Mixture of Experts—HME). Le modele HME est entraine a ponderer la contribution de chaque algorithme en fonction des donnees. Les resultats de cette combinaison des resultats d’algorithmes sont comparables avec les meilleurs resultats des algorithmes individuels, et s’averent plus robustes a travers differentes variations. Le niveau de contamination n’influence pas la performance relative du modele HME. Finalement, nous avons tente d’optimiser des methodes de detection d’epidemies en fonction des couts et benefices escomptes des predictions correctes et incorrects. Les resultats des algorithms de detection sont evalues en fonction des decisions possibles qui en decoulent et en tenant compte de donnees reelles sur les couts totaux d’utilisation des ressources du systeme de sante. Dans un premier temps, une regression polynomiale permet d’estimer le cout d’une epidemie selon le delai de detection. Puis, nous avons developpe un modele d’apprentissage d’arbre de decision qui tient compte du cout et qui predit les detections a partir des algorithmes connus. Les resultats experimentaux demontrent que ce modele permet de reduire le cout total des epidemies, tout en maintenant le niveau de detection des epidemies comparables a ceux d’autres methodes.----------ABSTRACT The past decade has seen the emergence of new diseases or expansion of old ones (such as Ebola) causing high human and financial costs. Hence, early detection of disease outbreaks is crucial. In the field of syndromic surveillance, there has recently been a proliferation of outbreak detection algorithms. The choice of outbreak detection algorithm and its configuration can result in important variations in the performance of public health surveillance systems. But performance evaluations have not kept pace with algorithm development. These evaluations are usually based on a single data set which is not publicly available, so the evaluations are difficult to generalize or replicate. Furthermore, the performance of different algorithms is influenced by the nature of the disease outbreak. As a result of the lack of thorough performance evaluations, one cannot determine which algorithm should be applied under what circumstances. Briefly, this research has three general objectives: (1) characterize the dependence of the performance of detection algorithms on the type and severity of outbreak, (2) aggregate the predictions of several outbreak detection algorithms, (3) analyze outbreak detection methods from a cost-benefit point of view and develop a detection method which minimizes the total cost of missing outbreaks and false alarms. To achieve the first objective, we propose a Bayesian network model learned from simulated outbreak data overlaid on real healthcare utilization data which predicts detection performance as a function of outbreak characteristics and surveillance system parameters. This model predicts the performance of outbreak detection methods with high accuracy. The model can also quantify the influence of different outbreak characteristics and detection methods on detection performance in a variety of practically relevant surveillance scenarios. In addition to identifying outbreak characteristics expected to have a strong influence on detection performance, the learned model suggests a role for other algorithm features, such as alerting threshold and taking weekly patterns into account, which was previously not the focus of attention in the literature. To achieve the second objective, we use Hierarchical Mixture of Experts (HME) to combine the responses of multiple experts (i.e., predictors) which are outbreak detection methods. The contribution of each predictor in forming the final output is learned and depends on the input data. The developed HME algorithm is competitive with the best detection algorithm in the experimental evaluation, and is more robust under different circumstances. The level of contamination of the surveillance time series does not influence the relative performance of the HME. The optimization of outbreak detection methods also relies on the estimation of future benefits of true alarms and the cost of false alarms. In the third part of the thesis, we analyze some commonly used outbreak detection methods in terms of the cost of missing outbreaks and false alarms, using simulated outbreak data overlaid on real healthcare utilization data. We estimate the total cost of missing outbreaks and false alarms, in addition to the accuracy of outbreak detection and we fit a polynomial regression function to estimate the cost of an outbreak based on the delay until it is detected. Then, we develop a cost-sensitive decision tree learner, which predicts outbreaks by looking at the prediction of commonly used detection methods. Experimental results show that using the developed cost-sensitive decision tree decreases the total cost of the outbreak, while the accuracy of outbreak detection remains competitive with commonly used methods.

Read the paper · More papers on PaperTik