Chunk and clause identification for basque by filtering and ranking with perceptrons

Iñaki Alegria, Bertol Arrieta, Xavier Careras, Arantza Díaz de Ilarraza, Larraitz Uria · Procesamiento del lenguaje natural · 2008

Este articulo presenta sistemas de identificacion de chunks y clausulas para el euskera, combinando gramaticas basadas en reglas con tecnicas de aprendizaje automatico. Mas concretamente, se utiliza el modelo de Filtrado y Ranking con el Perceptron (Carreras, Marquez y Castro, 2005): un modelo de aprendizaje que permite identificar estructuras sintacticas parciales en la oracion, con resultados optimos para estas tareas en ingles. Este modelo permite incorporar nuevos atributos, y posibilita asi el uso de informacion de diferentes fuentes. De esta manera, hemos anadido informacion linguistica en los algoritmos de aprendizaje. Asi, los resultados del identificador de chunks han mejorado considerablemente y se ha compensado la influencia del relativamente pequeno corpus de entrenamiento que disponemos para el euskera. En cuanto a la identificacion de clausulas, los primeros resultados no son demasiado buenos, debido probablemente al orden libre del euskera y al pequeno corpus del que disponemos actualmente.

Read the paper · More papers on PaperTik