Crosslingual implementation of linguistic taggers using parallel corpora

Hani Safadi · eScholarship@McGill (McGill) · 2008

Le sujet de cette thèse est la création de marqueurs linguistiques pour les langues qui sont pauvres en ressources en utilisant les marqueurs des langues riches en ressources. Les marqueurs linguistiques sont des classificateurs qui conjuguent des mots ou des collections des mots d'une phrase à un ensemble d'étiquettes. La description de nature grammatical et l'extraction des entités nommées sont deux exemples de marquage linguistique. L'apprentissage supervisé est l'outil principal utilisé pour créer des marqueurs linguistiques. Cela exige l'existence de données de formation marqués qui n'est pas disponible dans plusieurs langues. Nous décrivons une approche pour étiquer les phrases d'une langue cible qui est pauvre en ressources en utilisant un marqueur linguistique qui a été configuré dans une langue d'origine qui est riche en ressources. Cette approche n'exige pas que la phrase entrée doit être traduite dans la langue d'origine. Au lieu de cela, les étiquettes linguistiques sont projetées grâce à l'utilisation d'un corpus parallèle (une collection de textes qui sont disponibles dans plus d'une langues) entre la langue cible et la langue d'origine. La correspondence entre les mots de la langue cible et la langue d'origine nous permet de projeter les étiquettes entre les phrases de ces deux langues. Les étiquettes projetées sont traitées pour calculer l'étiquage finale de la phrase de la langue cible. Pour tester cette approche, un descripteur de nature grammaticale de langue française a été mis en oeuvre et évalué en utilisant un descripteur de nature grammaticale de langue anglaise et un corpus parallèle Anglais/Français. Un corpus parallèle entre la langue d'origine et la langue cible n'est pas toujours disponible pour plusieurs langues. Pour résoudre ce problème, nous décrivons un système d'acquisition automatique d'un corpus parallèle à partir du Web. Le corpus est extrait d'un domaine spécifique et automatiquem

Read the paper · More papers on PaperTik