Sub-corpora Sampling with an Application to Bilingual Lexicon Extraction

Ivan VuliÄ, Marie‐Francine Moens · International Conference on Computational Linguistics · 2012

We propose a novel associative approach for bilingual word lexicon extraction (BLE) from parallel corpora that relies on the paradigm of data reduction instead of data augmentation. The key insight of the approach is the effective usage of sub-corpora sampling and properties of low-frequency words in the task of lexicon induction, particularly in a setting where only limited parallel data are available. Word translation pairs are extracted from many smaller sub-corpora (sampled from the original corpus) according to several frequency-based criteria of similarity. We prove the validity of our data sampling approach, and show that this method outperforms IBM Model 1 and associative methods based on similarity scores and hypothesis testing in terms of precision and F-measure in the task of lexicon extraction. Additionally, we show that our sampling-based method can learn correct word translations from fewer data. TITLE AND ABSTRACT IN ANOTHER LANGUAGE (CROATIAN) Uzorkovanje Potkorpusa uz Primjenu u Ekstrakciji Dvojezicnih Rjecnika U radu se predlaže nov asocijativan pristup ekstrakciji dvojezicnih rjecnika iz usporednih korpusa koji se oslanja na paradigmu smanjivanja kolicine podataka umjesto njezinog povecavanja. Kljucna je ideja pristupa ucinkovita uporaba uzorkovanja potkorpusa te svojstava niskofrekventnih rijeci u zadatku indukcije rjecnika, posebice u situacijama kada je na raspolaganju ogranicen skup usporednih podataka. Prijevodni parovi rijeci ekstrahirani su iz veceg broja manjih potkorpusa (uzorkovanih iz izvornog korpusa) temeljem nekoliko frekvencijski utemeljenih kriterija slicnosti. U radu je pokazana ispravnost naseg pristupa temeljenog na uzorkovanju potkorpusa. Pokazano je da ovaj postupak u smislu F-mjere na zadatku ekstrakcije leksikona nadmasuje IBM-ov Model 1 te asocijativne postupke temeljene na ocjenama slicnosti i testiranju hipoteze. Takoder je pokazano da nas postupak temeljen na uzorkovanju može nauciti ispravne prijevode rijeci iz manjih kolicina podataka.

Read the paper · More papers on PaperTik