Tailored Feature Extraction for Lexical Disambiguation of English Verbs Based on Corpus Pattern Analysis

Martin Holub, Vincent Kr'iÅ ⁄, Silvie Cinková, Eckhard Bick · International Conference on Computational Linguistics · 2012

We give a report on a detailed study of automatic lexical disambiguation of 30 sample English verbs. We were drawing on a lexicon of English verb patterns based on the Corpus Pattern Analysis (CPA), which is a novel lexicographic method that seeks to cluster verb uses according to the morpho-syntactic, lexical and semantic/pragmatic similarity of their contexts rather than to associate them with abstract semantic definitions. We have trained several statistical classifiers to recognize these patterns, using morpho-syntactic as well as semantic features. In this paper we mainly concentrate on the procedures for feature extraction and feature selection and their evaluation. We show that tailoring the features to the verbs respectively, as they are implicitly contained in the pattern definitions (explicitly described in the lexicon), has the potential to significantly improve the accuracy of supervised statistical classifiers. TITLE AND ABSTRACT IN CZECH Rysy site na miru anglickým slovesům pro automatickou lexikalni disambiguaci pomoci Corpus Pattern Analysis Předkladame detailni studii automaticke lexikalni disambiguace na pilotnim vzorku ťriceti anglických sloves za použiti lexikonu vzorů slovesných užiti (patterns), který vychazi z Corpus Pattern Analysis (CPA). Tato inovatorska lexikograficka metoda namisto na abstraktnich definicich jednotlivých významů stavi na souhře morfosyntakticke, lexikalni a semanticke/pragmaticke podobnosti slovesných užiti. Natrenovali jsme několik statistických klasifikatorů na rozpoznavani těchto vzorů. Klasifikatory využivaji jak morfosyntaktických, tak semantických rysů. V nasi studii se sousťredime na procedury pro extrakci rysů, jejich výběr a jejich evaluaci. Ukazujeme, že rysy na miru uzpůsobene jednotlivým slovesům, jež jsou implicitně obsaženy v definici každeho vzoru v lexikonu, maji potencial významně zvýsit přesnost statistických klasifikatorů s ucitelem.

Read the paper · More papers on PaperTik