Detecting Malapropisms Using Measures of Contextual Fitness
Torsten Zesch · Trait. Autom. des Langues · 2012
While detecting simple language errors (e.g. misspellings, number agreement, etc.) is nowadays standard functionality in all but the simplest text-editors, other more complicated language errors might go unnoticed. A difficult case are errors that come in the disguise of a valid word that fits syntactically into the sentence. We use the Wikipedia revision history to extract a dataset with such errors in their context. We show that the new dataset provides a more realistic picture of the performance of contextual fitness measures. The achieved error detection quality is generally sufficient for competent language users who are willing to accept a certain level of false alarms, but might be problematic for non-native writers who accept all suggestions made by the systems. We make the full experimental framework publicly available which will allow other scientists to reproduce our experiments and to conduct follow-up experiments. RESUME. Alors que la detection d'erreurs simples est aujourd'hui une fonctionnalite standard des traitements de texte un peu evolues, de nombreuses erreurs restent difficiles a reperer. C'est souvent le cas lorsque la forme correcte est remplacee par une autre forme valide et syntaxique- ment plausible en contexte. Nous avons utilise les revisions de Wikipedia pour extraire automa- tiquement une listes d'erreurs de ce type. Ces donnees permettent de se faire une meilleure idee de l'utilite reelle des indicateurs standard de conformite contextuelle, qu'ils soient linguistiques ou statistiques. Les taux de detection obtenus sont generalement suffisants pour des scripteurs competents qui seraient prets a accepter un certain niveau de fausses alarmes ; ils restent prob- lematiques pour des scripteurs nonnatifs. L'ensemble du dispositif experimental utilise pour ce travail sera rendu public, ce qui permettra a d'autres chercheurs de reproduire nos experiences et d'approfondir nos resultats.