Privacy protection methods for documents and risk evaluation for microdata

Daniel Abril Castellano · TDX (Tesis Doctorals en Xarxa) · 2015

La capacitat de recollir i emmagatzemar informacio per agencies d'estadistica, governs o individus ha creat grans oportunitats d'analisi de les dades i la creacio de models basats en el coneixent. A mes, amb el creixement d'Internet moltes companyies han decidit canviar els seus antics models de negoci per uns basats en la venta i l'explotacio de les dades personals, les qual en molts dels casos contenen informacio confidencial. Aquest fet ha creat la necessitat de desenvolupar metodes per a la difusio de dades amb contingut confidencial amb fins de mineria de dades, assegurant que la informacio confidencial no pugui ser vinculada als individus als qual pertanyen. D'aquesta manera, les dades previament protegides poden ser transferides, publicades o venudes a terceres parts assegurant la confidencialitat dels individus que hi apareixen i a la vegada sent utils per aquells que les vulguin analitzar. Una area d'aplicacio molt clara son els documents de text els quals avui dia omplen la major part de la xarxa. Els documents de text son especialment dificils de protegir. A causa de la seva complicada estructura es dificil detectar les parts que poden contenir informacio sensible. En aquesta tesi s'ha distingit dos models diferents de proteccio de documents. Per una banda, s'ha considerat la proteccio de col·leccions de documents, de manera que aquests conjunts de textos puguin ser analitzats utilitzant tecniques classiques de mineria de textos i d'aprenentatge automatic. Per l'altra banda, s'ha considerat la proteccio individualitzada de cada document. La sanititzacio de documents es el proces habitual mitjancant el qual les parts sensibles o confidencials d'un text son detectades i eliminades. L'aplicacio manual d'aquesta tecnica es molt habitual per a la declassificacio i possible difusio de documents governamentals confidencials. D'aquesta manera, els governs demostren que estan a favor del dret a la llibertat d'informacio, mentre que la seguretat nacional no es veu compromesa. Aquesta tesi presenta un conjunt de proteccions i avaluacions per a la proteccio de textos. A mes, introdueix un metode d'aprenentatge supervisat per l'avaluacio del risc de revelacio per metodes de proteccio de microdades. Les principals contribucions d'aquesta tesi son les seguents: * El desenvolupament d'un metode semiautomatic per ajudar a la declassificacio de documents confidencials. * La formalitzacio de mesures especifiques per a l'avaluacio del risc de revelacio i la informacio perduda en aplicar metodes de proteccio per sanititzacio. * El desenvolupament de dos metodes basats en el principi de k-anonimitat per la proteccio de col·leccions de documents representades com un model d'espai vectorials. El primer metode explota la distribucio dels vectors mentre que el segon es basa en les possibles relacions semantiques dels vectors de paraules. * L'estudi de metodes avancats per avaluar el risc de revelacio d'informacio sensible sobre microdades despres de ser protegides. En particular, es proposa un metode d'aprenentatge supervisat per a l'enllac de registres basat en distancies. Aquest metode es basa en l'aprenentatge dels parametres proporcionats per una funcio. Diferents tipus de funcions han estat utilitzades per tal d'estudiar la seva eficacia en l'avaluacio del risc.

Read the paper · More papers on PaperTik