ENABLING TABULAR DATA UNDERSTANDING BY HUMANS AND MACHINES THROUGH SEMANTIC INTERPRETATION
Marco Cremaschi · BOA (University of Milano-Bicocca) · 2020
Esiste un numero significativo di documenti, report e pagine Web – un'analisi riporta 233 milioni di tabelle relazionali nel repository Common Crawl contenente un totale 2,85 miliardi di documenti – che fanno uso di tabelle per fornire informazioni che non possono essere facilmente elaborate dagli umani o capite dai computer. Per risolvere questo problema proponiamo un nuovo approccio che permetterà ai computer di interpretare la semantica di una tabella, e fornirà agli umani una rappresentazione più accessibile dei dati contenuti in essa. Per conseguire questo obiettivo, il problema principale è stato suddiviso in tre sotto-problemi: (i) la definizione di un metodo per fornire un'interpretazione semantica dei dati di una tabella; (ii) la definizione di un modello descrittivo che permetta ai computer di capire e condividere dati di una tabella; e (iii) la definizione di processi, tecniche e algoritmi per generare rappresentazioni dei dati in linguaggio naturale. Per quanto riguarda il sotto-problema (i), la rappresentazione semantica dei dati è stata ottenuta attraverso l'applicazione di tecniche di interpretazione di tabelle (table interpretation), che aiuta gli utenti ad identificare, in una maniera semi-automatica, il significato dei dati di una tabella e le relazioni tra di essi. Queste tecniche considerano in input una tabella e un Knowledge Graph, e restituiscono una rappresentazione RDF – un set di tuple – del contenuto della tabella, facendo riferimento ai concetti e alle proprietà del KG. Questa dissertazione presenta un nuovo approccio che, a partire dai lavori presenti in letteratura, ha portato allo sviluppo di un nuovo strumento, chiamato MantisTable, che effettua automaticamente un'interpretazione semantica completa della tabella. Gli esperimenti condotti hanno mostrato buoni risultati, rispetto alle tecniche e ai tool simili. Il sotto-problema (ii) è stato affrontato con la definizione di nuovi modi di rappresentazione dei dati: è stato definito un nuovo tipo di descrizione che combina la specifica OpenAPI con il linguaggio JSON-LD. I risultati delle tecniche di interpretazione semantica delle tabelle vengono così sfruttati per migliorare un formato già popolare, permettendo il recupero e il processamento dei dati tabellari. Il sotto-problema (iii) è stato affrontato definendo una tecnica di generazione del linguaggio naturale che utilizza una rete neurale per trasformare dati RDF, ottenuti dall'interpretazione delle tabelle, in frasi. Grazie a queste frasi, è possibile creare una rappresentazione testuale del contenuto delle tabelle. Questa è poi estendibile con informazioni aggiuntive provenienti da fonti che possono essere selezionate automaticamente utilizzando l'annotazione semantica.