Improving Recombination in a Linear EBMT System by Use of Constraints

Monica Gavrila · 2012

(Automatic) machine translation (MT) is one of the most challenging domains in Natural Language Processing (NLP) and plays an important role in ensuring global communication, especially in a multilingual world with access to large amounts of Internet resources. As rule-based MT approaches need manually developed resources, new MT directions have been developed over the last twenty years, such as corpus-based machine translation (CBMT): statistical MT (SMT) and example-based machine translation (EBMT). These new directions are based mainly on the existence of a parallel aligned corpus and, therefore, can be easily employed for lower-resourced languages. In this dissertation we showed how EBMT systems behave when a lower-resourced inflecting language (i.e. Romanian) is involved in the translation process. For this purpose we built an EBMT baseline system based only on surface forms (the Lin-EBMT system). One of our main goals was to investigate the impact of word-order constraints on the translation results: we integrated constraints extracted from generalized examples (i.e. templates) in Lin-EBMT and built an extended system: Lin- EBMTREC+. Although constraints represent a well-known method which is employed quite often in NLP, the use of word-order constraints in an EBMT system is an innovative approach which can open new paths in the domain of example-based MT. We run our experiments for two language-pairs in both directions of translation: Romanian-German and Romanian-English. This aspect raises interesting questions, as Romanian and German present language specific characteristics, which make the translation process even more challenging. Both EBMT systems developed are easily adaptable for other language-pairs. They are platform and language-pair independent, provided that a parallel aligned corpus for the language-pair exists and that the tools used for obtaining the needed intermediate information (e.g. word alignment) are available. As a side question, we studied how EBMT reacts in comparison to SMT. We compared the EBMT results obtained to results provided by a Moses-based SMT system and the Google Translate on-line system. To provide a complete view on CBMT, the performance of each MT system was assessed in several experimental settings, using different corpora (type and size), various system settings and additional part-of-speech (POS) information. We evaluated the translation results by means of three automatic evaluation metrics: BLEU, NIST and TER. A subset of the results was manually analyzed for a better overview on the translation quality. Our experiments showed that constraints improve translation results, although a clear decision which constraint-combination works best could not be taken. Although the SMT system outperformed the EBMT system in all experiments, the manual analysis provided cases in which EBMT offered more accurate results. The behavior of the systems while changing the experimental settings confirmed that (training and test) data have a substantial impact on both MT approaches. The difference between the results of the two MT approaches decreased when a more restricted corpus was used. As expected, both CBMT approaches worked better for shorter sentences. Die automatische maschinelle Ubersetzung (MU) ist einer der kompliziertesten Bereiche in der Sprachverarbeitung. Die MU spielt eine wichtige Rolle bei der Gewahrleistung der globalen Kommunikation in der mehrsprachigenWelt, die vor allem von Internetressourcen gestutzt wird. Da regelbasierte MU-Ansatze manuell entwickelte Ressourcen benotigen, wurden neue MU-Richtungen entwickelt, wie zum Beispiel die korpusbasierte maschinelle Ubersetzung (KMU): die statistische MU (SMU) und die beispielbasierte maschinelle Ubersetzung (BMU). Der Vorteil dieser neuen MU-Richtungen ist, dass sie auch fur Sprachen eingesetzt werden konnen, fur die weniger Ressourcen zur Verfugung stehen. In dieser Dissertation zeigen wir wie BMU-Systeme reagieren, wenn eine flektierende Sprache mit weniger Ressourcen (d.h. Rumanisch) in die Ubersetzung einbezogen wird. Zu diesem Zweck erstellen wir ein BMU-Grundsystem, das nur auf der Oberflachenform der Worter basiert (das Lin-EBMT System). Daruber hinaus untersuchen wir den Einfluss der Wortstellungsbeschrankungen (Constraints) auf die Ubersetzungsergebnisse. Wir extrahieren diese Constraints aus allgemeinen Beispielen (d.h. Templates) und integrieren sie in Lin-EBMT: das Lin-EBMTREC+ System. Obwohl die Verwendung von Constraints eine bekannte Methode in der Sprachverarbeitung ist, ist die Verwendung der Wortstellungsconstraints in einem BMU-System ein innovatives Konzept, das neue Wege in dem BMU-Bereich offnen konnte. Wir fuhren unsere Experimente fur zwei Sprachpaare in beide Richtungen der Ubersetzung durch: Rumanisch-Deutsch und Rumanisch-Englisch. Dieser Aspekt beinhaltet interessante Fragen, weil Rumanisch und Deutsch spezifische Spracheigenschaften haben, die den Ubersetzungsprozess noch komplizierter machen konnen. Die beiden entwickelten BMU-Systeme lassen sich sehr einfach an andere Sprachpaare anpassen. Die Systeme sind plattform- und sprachpaarunabhangig, vorausgesetzt ein Textkorpus von zweisprachigen Texten existiert und die Werkzeuge fur die Beschaffung der erforderlichen Informationen (zB Wort-Alignment) vorhanden sind. Als Nebenfrage untersuchen wir, wie BMU im Vergleich zu SMU reagiert. Daher vergleichen wir die BMU-Ergebnisse mit denen eines Moses-basierten SMU-Systems und denen des Google Translate Online-Systems. Die Leistung jedes MU-Systems wird in mehreren experimentellen Einstellungen untersucht. Wir verwenden verschiedene Korpora (sowohl Typ, als auch Grose), verschiedene Systemeinstellungen sowie zusatzliche Wortartinformationen. Wir evaluieren die Ubersetzungsergebnisse automatisch mit BLEU, NIST und TER. Ein Teil der Ergebnisse wird manuell analysiert, um einen besseren Uberblick uber die Qualitat der Ubersetzung zu erhalten. Unsere Experimente zeigen, dass Constraints die Ubersetzungsergebnisse verbessern konnen, obwohl eine klare Entscheidung dar uber, welche der Constraint-Kombinationen am besten funktioniert, nicht getroffen werden kann. Obwohl das SMU-System in allen Versuchen besser als das BMU-System ist, entdecken wir in der manuellen Analyse Falle, in denen BMU-Systeme besser als das SMU-System funktionieren. Das Verhalten der Systeme bestatigt wahrend des Wechsels der experimentellen Einstellungen, dass (Trening- und Test-) Daten einen hohen Einfluss auf beide MU-Ansatze haben. Der Unterschied zwischen den Ergebnissen der beiden MU-Ansatze verringert sich, wenn ein eingeschranktes Korpus verwendet wird. Wie schon erwartet, sind beide KMU-Ansatze besser, wenn kurzere Satze ubersetzt werden.

Read the paper · More papers on PaperTik