unimelb: Spanish Text Normalisation
Bo Han, Paul F. Cook, Timothy J. Baldwin · CEUR Workshop Proceedings · 2013
espanolEl presente articulo describe una aproximacion a la normalizacion de texto basada en lexico para tweets en espanol. En primer lugar se realiza una comparacion entre la normalizacion de texto en espanol e ingles y se plantea la hipotesis de que se puede adaptar un enfoque similar ya planteado previamente para el ingles. Para ello, se construye un lexico de normalizacion a partir de un corpus, utilizando similaridad distribucional, y se combina con otros lexicos existentes (por ejemplo diccionarios de jerga de Internet en espanol). Estos lexicos permiten una solucion rapida basada en busquedas. Los resultados experimentales indican que el lexico derivado del corpus complementa bien a los lexicos existentes, pero que la solucion puede mejorarse con un mejor manejo de ciertos tipos de palabras, como las entidades con nombre. EnglishThis paper describes a lexicon-based text normalisation approach for Spanish tweets. We first compare English and Spanish text normalisation, and hypothesise that an approach previously proposed for English can be adapted to Spanish. A corpus-derived normalisation lexicon is built using distributional sim- ilarity, and is combined with existing lexicons (e.g., containing Spanish Internet slang). These lexicons enable a very fast, look-up based approach to text normalisation. Experimental results indicate that the corpus-derived lexicon complements existing lexicons, but that the approach could be improved through better handling of certain word types, such as named entities.