Training Part-of-Speech Taggers to build Machine Translation Systems for Less-Resourced Language Pairs
Felipe Sánchez-Martínez, Carme Armentano-Oller, Juan Antonio Pérez-Ortiz, Mikel L. Forcada · RUA, Repositorio Institucional de la Universidad de Alicante (Universidad de Alicante) · 2007
Este articulo revisa el empleo de un método no supervisado para la \t\t\t\t obtención de desambiguadores léxicos categoriales para su empleo dentro del ingenio \t\t\t\t de traducción automática (TA) de código abierto Apertium. El método emplea \t\t\t\t el resto de módulos del sistema de TA y un modelo de la lengua destino de la \t\t\t\t traducción para la obtención de desambiguadores léxicos categoriales que después \t\t\t\t se usan dentro de la plataforma de TA Apertium para traducir. Los experimentos \t\t\t\t realizados con el par de lenguas occitano–catalán (un caso de estudio para pares \t\t\t\t de lenguas minorizadas con pocos recursos) muestran que la cantidad de corpus \t\t\t\t necesario para el entrenamiento es reducida comparado con los tamaños de corpus \t\t\t\t habitualmente usados con otros métodos de entrenamiento no supervisado como el \t\t\t\t algoritmo de Baum y Welch. Esto hace que el método sea especialmente apropiado \t\t\t\t para la obtención de desambiguadores léxicos categoriales para su empleo en TA \t\t\t\t entre pares de lenguas minorizadas. Además, la calidad de traducción del sistema \t\t\t\t de TA que utiliza el desambiguador léxico categorial resultante es comparativamente \t\t\t\t mejor.