Semantics in Finnish Distributional Language Models

Viljami Venekoski · Työväentutkimus Vuosikirja · 2016

Tietokonelingvistiikan menetelmien kehitys erityisesti neuroverkkoihin perustuvien kielimallien saralla on mahdollistanut tekstien ja näissä esiintyvien merkityssisältöjen tehokkaan mallintamisen suurten aineistojen pohjalta. Vaikka useita menetelmiä kielimallien rakentamiseen on esitetty, merkitys eli semantiikka on kuitenkin kompleksinen ilmiö, jonka mallintamisen tarkkuudesta ja validiteetista on esitetty verrattain vähän tutkimusta. Tämän tutkimuksen tarkoituksena on arvioida eri kielimallien validiteettia, erityisesti suhteessa suomenkielisen verkkokeskusteludatan sisältöjen representoimiseen. Malleja ja näihin liittyviä tietokonelingvistiikan menetelmiä arvioidaan kolmessa eri tutkimuksessa, joista kullakin estimoidaan eri semantiikan osa-aluetta. Tutkimuksessa käsitellyt kielimallit rakennettiin hyödyntäen word2vec-työkalua. Mallien opetusaineistona käytettiin yhteensä noin 2,6 miljardia sanetta sisältävää suomenkielisten verkkokeskustelujen Suomi24-korpusta. Yhteensä tutkimuksessa rakennettiin 18 kielimallia, joista kukin eri yhdistelmällä kielidatan ja –mallien käsittelyn menetelmiä. Malleja arvioitiin kolmessa tutkimuksessa. Tutkimuksessa I toteutettiin kyselytutkimus, jossa 55 ihmistä arvioivat 300 sanaparin sanojen samankaltaisuutta ja saatuja ihmisarvioita verrattiin tietokoneen tuottamiin samankaltaisuusarvioihin. Tutkimuksessa II selvitettiin, miten semanttisia suhteita voidaan hyödyntää kielimallin semantiikan arvioinnissa, minkä pohjalta muodostettiin 4 sanan analogioista koostuvat suomenkielinen testiaineisto kielimalleille. Tutkimuksessa III kielimalleja arvioitiin suhteessa niiden suoriutumiseen luokittelutehtävässä, jossa koneoppimisalgoritmi luokitteli mallin pohjalta representoidun Suomi24-keskustelualueen viestin yhteen keskustelualueen temaattisista kategorioista. Tulosten pohjalta voidaan päätellä, että esitetyt arviointimenetelmät ovat riittävän luotettavia ja keskenään komplementaarisia kielimallien semantiikan arvioimiseen. Arvioidut kielimallit puolestaan kykenivät mallintamaan semantiikkaa haastavan suomenkielisen some-aineiston pohjalta, ja aineistonkäsittelyn menetelmät paransivat mallinnuksen tarkkuutta.

Read the paper · More papers on PaperTik