Knowledge-poor approach to constructing word frequency lists, with examples from romance languages
Mikhail Alexandrov, Xavier Blanco, Alexander F. Gelbukh, Pavel Makagonov · Dipòsit Digital de Documents de la UAB (Universitat Autònoma de Barcelona) · 2004
Las listas de palabras con sus frecuencias se usan ampliamente en muchos procedimientos de agrupamiento y categorización de textos. Usualmente para la compilación de tales listas se usan las aproximaciones basadas en morfología (como el stemmer de Porter) para unir las palabras con el mismo significado. Desafortunadamente, tales aproximaciones requieren de muchos recursos lingüísticos dependientes de lenguaje cuando se trabaja con datos multilingües y colecciones multitemáticas de documentos. En este artículo se proponen dos procedimientos basados en formulas empíricas de similitud entre palabras. Un simple ajuste de los parámetros de las fórmulas permita su adecuación a diferentes lenguajes europeos. Se demuestra la aplicación de las fórmulas con ejemplos reales del francés, italiano, portugués y español.