Combining statistical and finite-state methods for machine translation

David Picó Vila · 2005

La traduccion automatica es un campo muy activo de las tecnologias del lenguaje natural que ha experimentado un fuerte desarrollo en las ultimas decadas, Las tecnicas que se han puesto en marcha podrian clasificarse, de manera un tanto simplista, en tecnicas basadas en el conocimiento, que utilizan informacion aportada por expertos linguistas, y tecnicas basadas en ejemplos, que extraen la informacion automaticamente a partir de corpus de texto. El trabajo de esta tesis se enmarca en la seguna familia de tecnicas, las basadas en ejemplos. Nos hemos centrado en el uso de un modelo en particular: el de los transductores estocasticos de estados finitos. Este modelo (y otros parecidos) se utiliza en muchas areas de las tecnologias del lenguaje y con finalidades diferentes. Nosotros lo utilizamos aqui para la traduccion entre lenguas distintas. La tesis aborda el problema de la creacion de transductores estocasticos de estados finitos a partir de muestras de traduccion. Estas muestras consisten en pares de frases en idiomas diferentes en los que una frase es traduccion de la otra. Por un lado, aportamos varios algoritmos para la estimacion de la parte probabilistica de los transductores, sobre el supuesto de que se conoce ya la estructura. Por otro lado, y como contribucion fundamental del trabajo, se expone un metodo y un conjunto de algoritmos para inferir transductores (con estructura y probabilidades) a partir de muestras, que agrupamos bajo las siglas genericas de GIATI (por el ingles, Grammatical inference algorithms. Esta memoria presenta una primera exposicion teorica de estos algoritmos, y continua con un estudio practico de implementacion en el que se exploran diferentes formas de poner en uso GIATI. Se presentan tambien estudios experimentales de traduccion que ponen de manifiesto las posibilidades reales de aplicacion de estas tecnicas.

Read the paper · More papers on PaperTik