Effects of Corpus Size on Word Similarity Model

Joni Oksanen · Työväentutkimus Vuosikirja · 2020

Tekstilouhinnan menetelmien avulla pystytään erottelemaan ja poimimaan oleellista tietoa suurista tekstiaineistoista. Näitä menetelmiä hyödyntäen voidaan tutkia Suomi24-keskustelupalstan viestejä ja sitä, miten käyttäjät puhuvat omasta terveydestään. Kahden käsitteen välistä semanttista samankaltaisuutta voidaan tarkastella vektoriavaruudessa kouluttamalla Word2Vec-malli, joka oppii sanojen väliset suhteet muodostamalla dataan sisältyville sanoille vektoriesitykset. Tutkielmassa selvitetään korpuksen koon vaikutusta sanojen samankaltaisuusmallien kouluttamisessa. Korpuksen koon vaikutusta tutkitaan vertaamalla mitattuja kosinin samankaltaisuuden etäisyyksiä sanojen vektoriesitysten välillä kahdessa vektoriavaruudessa, jotka ovat muodostettu hyödyntämällä erikokosia korpuksia. Työssä käytetään kahta korpusta, joista yksi sisältää vain viestejä Suomi24:n terveyskeskustelualueelta. Toinen korpus sisältää terveyskeskusteluviestien lisäksi viestejä muilta keskustelualueilta, jotka sisältävät terveysaiheisia sanoja. Kosinin samankaltaisuutta arvioidaan hyödyntämällä käsitelistoja olennaisista terveysaiheisista sanoista. Kun datan määrää kasvatetaan lähes 30 prosenttia, huomataan, että kasvattamisella ei ole huomattavaa vaikutusta datan ominaispiirteisiin. Tulokset eivät osoittaneet selkeää yhteyttä korpuksen koon ja mitattujen terveysaiheisten sanojen vektoriesitysten kosinin samankaltaisuuksien välillä.

Read the paper · More papers on PaperTik