A Part-of-Speech Tag Clustering for a Word Prediction System in Portuguese Language
Daniel Cruz Cavalieri, Teodiano Bastos-Filho, Mário Sarcinelli-Filho, Sira Elena Palazuelos Cagigas, Javier Macías-Guarasa, José Luis Martín Sánchez · RUA, Repositorio Institucional de la Universidad de Alicante (Universidad de Alicante) · 2011
Este trabajo presenta un método automático para reducir el conjunto de categorías de palabras que será utilizado por un sistema de predicción de palabras en Portugués. El método se basa en una medida de similitud que se aplica a una matriz de asociación, generada mediante el empleo de una medida de disparidad (odds ratio) aplicada sobre la matriz de distribución de probabilidades de bigramas de categorías (bipos) presentes en un corpus. Los resultados presentados en este trabajo muestran que la utilización del método de agrupamiento propuesto, con un umbral adecuado de similitud, tiene potencial para mejorar el sistema de predicción de palabras. Además posibilita la utilización de nuevas técnicas de agrupamiento de categorías como agrupamiento borroso. Los resultados también muestran que cuando se utiliza un sistema de predicción de palabras basado en un modelo sintáctico, la agrupación no se puede realizar entre las categorías sintácticas más importantes, aunque los grupos generados parezcan correctos desde el punto de vista lingüístisco.