Rapid Development of Language Resources
Marek Grác · 2013
Pocitacove zpracovani přirozeneho jazyka (NLP) je obor, který se nachazi na pomezi lingvistiky a informatiky. Při zpracovani jazyka jsou důležite nejen algoritmy, ale i datove zdroje specificke pro konkretni jazyk, kterými jsou např. gramatiky, slovniky ci korpusy. V soucasnosti dokažeme vytvařet obrovske jazykove zdroje pomoci automatických metod, ale na jejich trenovani a testovani je potřeba využivat kvalitnějsi zdroje. Tvorba i rucni zpracovani jsou vsak velmi narocne nejen na finance a cas, ale i na trenink a zauceni jazykových expertů. Tyto důvody objasňuji, proc mame k dispozici dostatek automaticky tvořených jazykových zdrojů, ale pro mensi jazyky pociťujeme nedostatek těch kvalitnějsich, rucně anotovaných. Existujici literatura podrobně popisuje teoreticke zaklady použite při navrhu rucně anotovaných dat, ale samotný proces anotace je představen jen zběžně. Tato dizertacni prace se zabýva pravě timto procesem, popisuje vse od navrhu vhodných struktur pro ukladani dat až po vyhodnoceni kvality anotace. Vzhledem k tomu, že v soucasne době je prakticky nemožne ziskat dostatek prostředků na jejich tvorbu dosud použivanými technikami, rozhodli jsme se přizpůsobit nase metodologicke doporuceni těmto omezujicim podminkam. Nasim cilem je vytvařet jazykove zdroje, ktere se budou moci efektivně využivat na trenovani a testovani a přitom naklady na jejich tvorbu budou výrazně nižsi. Při tvorbě nasich doporuceni jsme se inspirovali agilnimi technikami využivanými při tvorbě softwaru. Vychazejice z omezených prostředků jsme se rozhodli pro tvorbu jazykových zdrojů, ktere budou založeny výhradně na datech předzpracovaných existujicimi NLP nastroji. Diky tomu bude uloha anotatorů omezena pouze na ověřovani spravnosti předkladaných vstupů. Nevýhodou tohoto přistupu je fakt, že výsledný zdroj nebude obsahovat data, ktera se nevyskytnou ve výstupu aplikaci. Na ověřeni životaschopnosti nasich doporuceni jsme vytvořili dva nove jazykove zdroje. Prvni jazykový zdroj nazvaný BushBank vznikl z potřeby automaticky testovat kvalitu gramatik použivaných v syntaktických analyzatorech. Vzhledem k jejich odlisným teoretickým zakladům bylo vhodne se zaměřit jen na znackovani elementů, ktere se daji převest do stejne podoby. Výstup ze syntaktických analyzatorů byl převeden do mělci podoby. Jelikož každa věta byla zpracovana několika analyzatory, syntaktický strom nebyla vhodna struktura, protože nedokaže zachytit nejednoznacnost. Z tohoto důvodu jsme zavedli strukturu 'syntactic bush', ktera ma požadovane vlastnosti. Na zakladě oznackovaných dat jsme byli schopni natrenovat nastroj na rozpoznavani jmenných frazi, jehož výstup překonava nastroje použite na tvorbu BushBanku. V soucasnosti mame k dispozici dva větsi korpusy typu bushbank, ktere obsahuji vic než 40 tisic vět. Druhým vytvořeným jazykovým zdrojem je semanticka siť Sholva, ktera vznikla za cilem ověřit možnost využiti semantiky v existujicich projektech vyvijených v Centru zpracovani přirozeneho jazyka. Vzhledem k jejich aktualnimu stavu jsme se rozhodli Sholvu vytvařet hlavně pro potřeby morfologicke desambiguace a syntakticke analýzy. Na rozdil od existujicich zdrojů využivame i negativni informace (např. postel neni clověk). To nam umožňuje řesit situace i bez toho, abychom měli přesnou představu o uplnem významu konkretniho slova. Při tvorbě prototypu jsme anotovali několik zakladnich atributů pro frekventovana slova. Celkem jsme vytvořili vic než 400 tisic udajů tohoto typu. Na zakladě porovnani prototypu s existujicim semantickým zdrojem jsme boli schopni ukazat, že využiti Sholvy poskytuje pro testovaci a