Extracción de Corpus Paralelos de la Wikipedia basada en la Obtención de Alineamientos Bilingües a Nivel de Frase
Joan Albert Silvestre-Cerdà, Maria Mercedes Garcia Martinez, Luis Alberto Barrón Cedeño, Jorge Civera Saiz, Paolo Rosso · RiuNet (Universitat Politècnica de València) · 2011
[EN] This paper presents a proposal for extracting parallel corpora from Wikipedia on the basis of statistical machine translation techniques. We have used word-level alignment models from IBM in order to obtain phrase-level bilingual alignments between documents pairs. We have manually annotated a set of test English-Spanish comparable documents in order to evaluate the model. The obtained results are encouraging.