Knowledge mining using robust clustering
Sami Äyrämö · Jyväskylä University Digital Archive (University of Jyväskylä) · 2006
FM Sami Äyrämö tutki väitöstyössään suurten digitaalisten tietomassojen tehokasta hyödyntämistä ja siihen sovellettavia laskennallisesti älykkäitä niin kutsuttuja tiedonlouhintamenetelmiä (data mining). Aihe on ajankohtainen, sillä informaatiojärjestelmien nopea kehittyminen ja yleistyminen johtavat entistä useammin ”datatulvaan": digitaalisessa muodossa kerätään tietoa niin paljon, että oleellinen informaatio voi hukkua epäoleellisen ja moninkertaisen tiedon sekaan.Väitöstyönsä päätuloksena Äyrämö esittelee luotettavan, laskennallisesti tehokkaan ja käyttäjälle yksinkertaisen klusterointimenetelmän, joka ei ota kantaa sovelluskohteeseen ja on siten hyvin yleiskäyttöinen. Menetelmän pohjana Äyrämö on käyttänyt niin sanottuja prototyyppipohjaisia osittavia klusterointialgoritmeja.Usein tietovarastot ovat liian suuria selailtavaksi manuaalisesti tietokoneella. Datan klusteroinnin tavoitteena on löytää datasta ryhmiä eli klustereita, joiden sisällä havainnot ovat mahdollisimman samanlaisia ja erot ryhmien välillä mahdollisimman suuria. Näin voidaan yksittäisten havaintojen sijaan tarkastella joko ryhmien tai niitä parhaiten kuvaavien havaintojen eli prototyyppien ominaisuuksia.Äyrämön menetelmässä luotettavuus on saavutettu soveltamalla prototyyppien laskentaan niin sanottuja robusteja moniulotteisia estimaatteja, jotka eivät reagoi yhtä herkästi datassa esiintyvään virheisiin ja puutteisiin kuin perinteisemmät vaihtoehdot.Osaksi klusterointimenetelmää Äyrämö on kehittänyt niin kutsuttuun SOR-menetelmään perustuvan iteratiivisen algoritmin, jolla prototyyppiestimaatteja voidaan tehokkaasti ja tarkasti approksimoida. Klusterointimenetelmä kaikkine komponentteineen on toteutettu niin, että loppukäyttäjän ei tarvitse tehdä monimutkaisia esikäsittelyoperaatioita, kuten puuttuvien arvojen ennustamista, ennen varsinaista ryhmittelyä. Menetelmään on myös toteutettu alustusmenetelmä, joka automatisoi menetelmää tuottamalla ryhmittelyalgoritmin parametreille mahdollisimman hyvät alkuarvaukset.