Statistical analysis of multivariate infectious disease surveillance time series

Michaela Paul · Zurich Open Repository and Archive (University of Zurich) · 2011

Zum wirkungsvollen Schutz der Gesundheit der Bev¨lkerung haben viele L¨nder nationale o a ¨ Uberwachungssysteme aufgebaut, die fortlaufend Daten f¨r eine Reihe meldepflichtiger u Krankheiten sammeln. Die Analyse und Modellierung solcher Meldedaten tr¨gt wesentlich dazu a bei, die Ausbreitung von Krankheiten zu begrenzen und zu verhindern. In der vorliegenden Arbeit wird statistische Methodik f¨r die Analyse von multivariaten Zeitreihen von Z¨hldaten u a ¨ entwickelt, wie sie von Uberwachungseinheiten im Rahmen des Infektionsschutzes gesammelt werden. Ziel dieser Dissertation ist es ein flexibles Modell bereitzustellen mit dem sowohl zeitliche und r¨umlich-zeitliche Trends in den Daten, als auch Abh¨ngigkeiten zwischen verschiedenen a a Krankheiten erkl¨rt werden k¨nnen. Um eine einfache Benutzung der Modelle zu gew¨hrleisten, a o a wurde s¨mtliche Methodik im frei erh¨ltlichen R-Paket ‘surveillance’ implementiert. a a Die Modellierung von Ausbr¨chen und Unregelm¨sigkeiten in den Daten stellt eine u a besondere Herausforderung dar. Ausgehend von einem Verzweigungsprozess wird dies mittels einer autoregressiven Formulierung erreicht. M¨gliche Abh¨ngigkeiten zwischen mehreren o a Krankheiten k¨nnen durch die Einf¨hrung krankheitsspezifischer Parameter untersucht werden. o u Die Analyse von w¨chentlichen Influenza und Meningokokken Fallzahlen weist empirisch darauf o hin, dass eine vorangehende Influenza-Erkrankung die Infektion mit Meningokokken beg¨nstigt. u Um die r¨umliche Ausbreitung einer Krankheit besser widerzuspiegeln, k¨nnen in einem a o r¨umlich-zeitlichen Kontext auch externe Daten, wie z.B. Informationen uber das Reiseverhalten, a ¨ genutzt werden. Die Formulierung des nicht-linearen autoregressiven Modells wird erweitert um regionale ¨ Unterschiede bez¨glich der Ubertragung und Inzidenz bei in hohem Mase stratifizierten u Zeitreihen ber¨cksichtigen zu k¨nnen. Regionale Heterogenit¨t kann durch Unterschiede in der u o a Alters- und Geschlechtsstruktur, dem Impfstatus der Bev¨lkerung oder der Umweltbedingungen o in der jeweiligen Region verursacht werden. Abh¨ngig davon ob geeignete Information bez¨glich a u solcher Faktoren vorhanden ist oder nicht werden zwei Modellerweiterungen entwickelt. Der erste Ansatz schliest unkorrelierte und r¨umlich korrelierte zuf¨llige Effekte im Modell a a mit ein. Inferenz f¨r dieses Modell basiert auf einem penalisierten Likelihood Ansatz. u Varianz Parameter werden mittels marginaler Likelihood gesch¨tzt. F¨r die Sch¨tzung a u a korrelierter zuf¨lliger Effekte wird das Sch¨tzverfahren entsprechend angepasst. Da klassische a a Modellwahlkriterien wie AIC oder BIC bei Vorliegen zuf¨lliger Effekte problematisch sein a k¨nnen, basiert die Modellwahl auf Ein-Schritt-Vorhersagen und Proper Scoring Rules. In zwei o Anwendungen wird gezeigt, dass sich die pr¨diktive G¨te bei Ber¨cksichtigung von bestehender a u u Heterogenit¨t mittels zuf¨lliger Effekte verbessert. a a Wenn Heterogenit¨t durch bekannte und beobachtbare Faktoren bedingt ist kann diese a Information mit Hilfe eines Regressionsansatzes direkt in Bezug zu den autoregressiven Parametern gesetzt werden. Solch ein Regressionsansatz erm¨glicht auch die Spezifikation o zeitlich variierender autoregressiver Parameter, beispielsweise um die Wirkung von Interventionen abzubilden. In einer Anwendung auf Masern Surveillance Daten aus Deutschland werden l¨nderspezifische Durchimpfungsraten genutzt um regionale Unterschiede im Verlauf der a Inzidenz zu erkl¨ren. a To meet the threats of infectious diseases, many countries have established surveillance systems for the routine collection of infectious disease data. The analysis and modelling such notification data is essential in the attempt to control and prevent disease. In this thesis, statistical methodology for the analysis of multivariate time series of counts as collected in surveillance systems on notifiable diseases is developed. The aim is to provide a flexible model which is able to explain the temporal and spatio-temporal patterns in the data, as well as account for dependencies between different pathogens. The methodology is implemented in the open-source R-package ‘surveillance’ which facilitates its use in practice. A particular challenge is the modelling of outbreaks and irregularities in the data. Motivated by a branching process formulation, well-known in infectious disease epidemiology, the epidemic behavior is modelled via an autoregressive formulation. Possible dependencies between related diseases are analyzed by introducing disease-specific parameters. An analysis of weekly influenza and meningococcal disease counts shows empirical evidence that influenza infections predispose meningococcal disease. In a spatio-temporal context, we propose incorporating external data such as travel intensities between regions to better reflect the regional spread of a disease. The non-linear autoregressive model formulation is further extended to integrate regional heterogeneity in disease transmission and incidence for highly multivariate time series. Such differences may be due to age, sex, vaccination status or environmental conditions. Two approaches to address heterogeneity are developed, depending on whether or not suitable covariate information about such factors is available. In the first approach, uncorrelated and spatially correlated random effects are included in the model. The random effects may describe heterogeneity in disease incidence levels as well as in the autoregressive coefficients, relating disease incidence to past counts in the same or neighboring regions. Inference for this non-standard model is based on penalized likelihood methodology. Variance parameters are estimated using marginal likelihood. The estimation procedure is adapted to handle correlated random effects. As classical model choice criteria such as AIC or BIC can be problematic in the presence of random effects, model choice is performed using one-step-ahead predictions and proper scoring rules. As exemplified by two applications, the predictive performance improves if existing heterogeneity is accounted for via random effects. When heterogeneity is due to known and observable factors, this information can be directly related to for example the autoregressive parameters via a regression formulation. Such a formulation also permits the autoregressive parameter to vary over time, for instance to reflect public health interventions. In an application to German measles surveillance data, region-specific vaccination coverage levels are used to explain regional differences in the incidence pattern.

Read the paper · More papers on PaperTik