Integrating Lexical, Syntactic and System-based Features to Improve Word Confidence Estimation in SMT
Ngoc Quang Luong · 2012
L’estimation des mesures de confiance (MC) au niveau des mots consiste a predire leur exactitude dans la phrase cible generee par un systeme de traduction automatique. Ceci permet d’estimer la fiabilite d'une sortie de traduction et de filtrer les segments trop mal traduits pour une post-edition. Nous etudions l’impact sur le calcul des MC de differents parametres : lexicaux, syntaxiques et issus du systeme de traduction. Nous presentons la methode permettant de labelliser automatiquement nos corpus (mot correct ou incorrect), puis le classifieur a base de champs aleatoires conditionnels utilise pour integrer les differents parametres et proposer une classification appropriee des mots. Nous avons effectue des experiences preliminaires, avec l’ensemble des parametres, ou nous mesurons la precision, le rappel et la F-mesure. Finalement nous comparons les resultats avec notre systeme de reference. Nous obtenons de bons resultats pour la classification des mots consideres comme corrects (F-mesure : 86.7%), et encourageants pour ceux estimes comme mal traduits (F-mesure : 36,8%).