Flexible statistical construction of bilingual dictionaries
Ismael Pascual Nieto, Michael O’Donnell · Procesamiento del lenguaje natural · 2007
Resumen: La mayoria de los sistemas previos para construir un diccionario bilingue a partir de un corpus paralelo dependen de un algoritmo iterativo, usando probabilidades de traduccion de palabras para alinear palabras en el corpus y sus alineamientos para estimar probabilidades de traduccion, repitiendo hasta la convergencia. Si bien este enfoque produce resultados razonables, es computacionalmente lento, limitando el tamano del corpus que se puede analizar y el del diccionario producido. Nosotros proponemos una aproximacion no iterativa para producir un diccionario bilingue unidireccional que, si bien menos precisa que las aproximaciones iterativas, es mucho mas rapida, permitiendo procesar corpora mayores en un tiempo razonable. Asimismo, permite una estimacion en tiempo real de la probabilidad de traduccion de un par de terminos, lo que significa que permite obtener un diccionario de traduccion con los n terminos mas frecuentes, y calcular las probabilidades de traduccion de terminos infrecuentes cuando se encuentren en documentos reales. Palabras clave: diccionarios bilingues, modelos palabra-a-palabra, traduccion automatica estadistica