Scalability of Semantic Analysis in Natural Language Processing
Radim Řehůřek · 2011
Prace se zabýva dolovanim dat z rozsahlých korpusů. Zaměřuje se na robustni statisticke metody, ktere dokaži automatizovaně vytvořit kompaktni semantickou reprezentaci volneho textu, tj. bez použiti metadat ci rucniho vstupu clověka. Prvni cast prace se zabýva skalovatelnosti metod Latent Semantic Analysis (LSA) a Latent Dirichlet Allocation (LDA). Představuji nove algoritmy pro skalovatelnou tvorbu těchto semantických modelů. Skalovatelnost je dosažena 1) distribuci výpoctů na vice strojů a 2) využitim pouze konstatniho množstvi paměti vzhledem k velikosti trenovacich dat, a 3) trenovanim modelu v omezenem poctu průchodů trenovacimi daty (resp. pouze na jeden průchod v připadě LSA, což umožňuje trenovani na nekonecnem, nestacionarnim proudu trenovacich dat). Druha cast prace popisuje několik možných aplikaci těchto obecných semantických algoritmů. Prezentuji zde výsledky sveho výzkumu v oblasti Information Retrieval (IR), jako je např. tematicka segmentace volneho textu, semanticka podobnost dokumentů v digitalnich knihovnach ci efektivni segmentace textu podle jazyka. Soucasti prace je take open-source software, který obsahuje implementaci těchto metod.