Initial explorations in Kazakh to English statistical machine translation
Zhenisbek Assylbekov, Assulan Nurkas · 2014
English. This paper presents preliminary results of developing a statistical machine translation system from Kazakh to English. Starting with a baseline model trained on 1.3K and then on 20K aligned sentences, we tried to cope with the complex morphology of Kazakh by applying different schemes of morphological word segmentation to the training and test data. Morphological segmentation appears to benefit our system: our best segmentation scheme achieved a 28% reduction of outof-vocabulary rate and 2.7 point BLEU improvement above the baseline. Italiano. Questo articolo presenta dei risultati preliminari relativi allo sviluppo di un sistema di traduzione automatica statistica dal Kazaco all’Inglese. Partendo da un modello di base, addestrato su 1.3K e 20K coppie di frasi, proviamo a gestire la complessa morfologia del Kazaco utilizzando diversi schemi di segmentazione morfologica delle parole sui dati di addestramento e di valutazione. La segmentazione morfologica sembra apportare benefici al nostro sistema: il nostro migliore schema di segmentazione ottiene una riduzione del 28% del “Out-ofVocabulary Rate” ed un miglioramento di 2.7 punti della misura “BLEU” rispetto al sistema di base.