Exploiting lexical information and discriminative alignment training in statistical machine translation

Patrik Lambert, Rafael E. Banchs · 2008

El trabajo de la tesis se ha enmarcado en tres aspectos de la traduccion automatica estadistica: el uso de informacion lexica como modelos lexicos basicos o expresiones multi-palabras, estrategias de entrenamiento por minimizacion del error, y finalmente modelos de alineado a nivel de palabra, Estos aspectos han sido estudiados en el marco del sistema de traduccion basado en n-gramas. Segun este enfoque, la probabilidad de traduccion conjunta se modela a traves de una combinacion log-lineal compuesta de un modelo de n-gramas bilingue asi como de funciones caracteristicas adicionales. En primer lugar, se ha estudiado en profundidad el tema de la evaluacion del alineado. In particular, se destaca el impacto en los resultados de la manera con la que la referencia de alineado esta construida, y se dan pautas para alinear manualmente un corpus. A continuacion, se describe el sistema de traduccion automatica basado en n-gramas. Despues de esta descripcion, se evalua el impacto sobre la calidad del alineado de clasificaciones linguisticas como lematizacion, stemming o clasificacion de verbos. Aunque estas transformaciones tienen un impacto importante sobre el alineado a nivel de palabras, esta mejora no se repercuta a nivel de calidad de traduccion. Se examina tambien el impacto sobre la calidad del alineado y sobre la exactitud de la traduccion de agrupar expresiones multi-palabras antes del alineado. Otro objetivo de esta tesis era la mejora de estrategias de entrenamiento por minimizacion del error. Dos lineas de investigacion se consideraron: la eleccion de la metrica utilizada como funcion objetivo y la mejora del propio algoritmo de optimizacion. En la primera linea de investigacion, los parametros fueron optimizados satisfactoriamente en funcion del valor de la medida Queen del marco de evaluacion Qarla. Este marco combina diferentes metricas con un criterio estable y robusto. En la secunda linea de investigacion, el algoritmo SPSA (aproximacion estocastica por perturbacion simultanea) se comparo al metodo del simplex. Por ultimo, se propone un nuevo marco para el entrenamiento discriminativo de modelos de alineado con metricas automaticas de traduccion como criterio de maximizacion. Para poder evaluar este marco, se ha implementado un sistema de alineado basado en modelos discriminativos adaptados al sistema de traduccion por n-gramas, y se pudo observar una mejora de los resultados de metricas automaticas con corpora pequenos. Se ha extendido este marco para corpora grandes, entrenando los parametros del sistema de alineado con una parte pequena del corpus y utilizandolos para alinear el corpus entero. Los parametros obtenidos generaron sistemas de traduccion tan buenos como los que se pueden obtener con herramientas estandares de alineado, pero de una manera mucho mas flexible y con mucho menos recursos computacionales.

Read the paper · More papers on PaperTik