Learning Markov Equivalence Classes of Gaussian DAGs via Observational and Interventional Data: an Objective Bayes Approach
Federico Castelletti · BOA (University of Milano-Bicocca) · 2018
I modelli grafici basati sull'utilizzo di grafi direzionati (Directed Acyclic Graphs, DAG) hanno acquisito negli ultimi decenni un'ampia popolarità per lo studio della dipendenza tra variabili in molteplici ambiti scientifici. Tipicamente lo scopo è fare inferenza su un modello attraverso i dati, ovvero misurare relazioni di dipendenza tra variabili. La famiglia di indipendenze (marginali) e condizionali codificate dal DAG determinano la sua proprietà markoviana. DAG che racchiudono le medesime indipendenze condizionali sono detti Markov equivalenti. È tuttavia noto che l'utilizzo di dati di natura puramente osservazionale non consenta di "distinguere" tra DAG Markov equivalenti. Questi sono quindi partizionati in classi di equivalenza, ciascuna delle quali viene rappresentata da un grafo a catena detto essential graph. Quando l'obiettivo è fare inferenza sul modello generatore dei dati è quindi più conveniente esplorare lo spazio degli essential graph (rispetto allo spazio dei DAG), sebbene la dimensione di questo cresca "più che esponenzialmente" nel numero di variabili (nodi del grafo). Per lungo tempo lo studio degli essential graph è stato quindi confinato a "dimensioni" modeste dello spazio. Tuttavia, per superare tale limite, negli ultimi anni sono stati proposti diversi metodi basati sull'utilizzo di catene di Markov. In diverse applicazioni (di carattere tipicamente biologico e genomico) si dispone di dati di tipo "interventistico", ossia prodotti a seguito di perturbazioni esogene di variabili o "esperimenti randomizzati". La nozione di intervento è strettamente legata all'interpretazione causale del DAG. Intervenendo su una variabile è possibile "rimuovere" la dipendenza di altre variabili sulla stessa, ossia modificare la proprietà markoviana del DAG. Questo determina una partizione dei DAG in classi di equivalenza di dimensione "più contenuta", ciascuna delle quali viene rappresentata da un interventional essential graph. Pertanto, laddove si disponga di dati di natura interventistica, la selezione del modello generatore dei dati può essere rivolta all'esplorazione di tale spazio; in tal modo è possibile "migliorare" l'identificazione del DAG generatore dei dati. Nel presente lavoro si affronta il problema della selezione di modelli grafici gaussiani attraverso una metodologia di tipo bayesiano. Nello specifico, si adotta un approccio oggettivo basato sulla nozione di fractional Bayes factor. A questo scopo, ricaviamo una formula per il calcolo della verosimiglianza marginale di un interventional essential graph in presenza di dati di natura osservazionale e interventistica. In seguito, procediamo alla costruzione di una catena di Markov per l'esplorazione dello spazio degli interventional essential graph sotto condizioni di sparsità. Proponiamo quindi un algoritmo di tipo MCMC per approssimare la posterior distribution degli interventional essential graph e "quantificare" misure di incertezza come la probabilità di inclusione di un edge. Applichiamo infine la metodologia proposta, denominata Objective Bayesian Interventional Essential graph Search, a studi di simulazione e per l'analisi di protein-signaling data, laddove dati di natura interventistica corrispondono a rilevazioni effettuate sotto differenti condizioni sperimentali.