Modeling and computational aspects of dependent completely random measures in Bayesian nonparametric statistics

Ilaria Bianchini · 2018

La statistica bayesiana nonparametrica e un'area di ricerca molto attiva, grazie alla sua flessibilita e alle piu svariate applicazioni che motivano il suo sviluppo, dal machine learning alla medicina. In particolare, una parte della letteratura piu recente e dedita all'introduzione di processi stocastici dipendenti (dal tempo, da covariate, ecc..) da utilizzare come prior nei modelli nonparametrici. Infatti, la tipica assunzione di scambiabilita non sempre e appropriata: in molti contesti, e possibile sfruttare delle informazioni aggiuntive, cioe le covariate, per migliorare la performance del modello statistico. In sintesi, processi nonparametrici dipendenti estendono le distribuzioni a-priori note in letteratura definite per misure, partizioni, ecc., su collezioni di tali oggetti matematici. Ogni elemento di questa collezione e associato a valori nello spazio delle covariate, come il tempo o altri tipi di misurazioni. Questa tesi illustra diversi approcci modellistici, motivati da applicazioni reali, il cui obiettivo e fare stima di densita e raggruppamento dei dati. Dopo aver introdotto i concetti di base della statistica bayesiana nonparametrica che vengono usati nella tesi, vengono presentati quattro capitoli contenenti il contributo originale di questo lavoro. Nella prima parte viene illustrato un'approssimazione di misure di probabilita aleatorie basate su un troncamento a-priori: queste vengono usate in modelli mistura la cui misturante e una misura completamente aleatoria normalizzata. Uno degli esempi, in particolare, considera il caso in cui il supporto della misura dipende dalle covariate. Un approccio molto differente e quello adottato nel capitolo successivo, dove le covariate influenzano in modo diretto la prior sulla partizione aleatoria. Il modello e motivato da un interessante problema applicativo in ambito sanitario: analizzare il comportamento dei donatori di sangue. A seguire, affrontiamo il problema della sovrastima del numero di gruppi nei modelli mistura: qui viene proposto ed illustrato un modello che a-priori induce separazione tra i parametri delle componenti della mistura, attaverso l'impiego di processi di punto che dipendono dal determinante di una certa matrice di varianza e covarianza. Le covariate sono incluse nel modello attraverso un approccio tipo ``mistura di esperti''. Infine, introduciamo una classe di processi dipendenti dal tempo che vivono nello spazio di particolari misure completamente aleatorie. I processi hanno una struttura di tipo autoregressivo e possono essere utilizzati facilmente in modelli piu complessi.

Read the paper · More papers on PaperTik