Implementation of Modified Kneser-Ney Smoothing on Top of Generalized Language Models for Next Word Prediction
Martin Körner · 2014
Next Word Prediction beschreibt die Aufgabe, das Wort vorzuschlagen, welches ein Nutzer mit der hochsten Wahrscheinlichkeit als Nachstes eingeben wird. Momentane Ansatze basieren auf der Analyse sogenannter Corpora (grose Textdateien) durch empirischen Methoden. Die resultierende Wahrscheinlichkeitsverteilungen uber die vorkommenden Wortsequenzen werden als Language Models bezeichnet und zur Vorhersage des wahrscheinlichsten Wortes genutzt. Verbreitete Language Models basieren auf n-gram Sequenzen und Smoohting Algorithmen wie beispielsweise dem modifizierten Kneser-Ney Smoothing zur Anpassung der Wahrscheinlichkeit von ungesehenen Sequenzen. Vorherige Untersuchungen haben gezeigt, dass das Einfugen von Platzhaltern in solche n-gram Sequenzen zu besseren Ergebnissen fuhren kann, da dadurch die Berechnung von seltenen und ungesehenen Sequenzen weiter verbessert wird. Das Ziel dieser Arbeit ist die Formalisierung und Implementierung dieses neuen Ansatzes, wobei zusatzlich das modifizierte Kneser-Ney Smoothing eingesetzt werden soll.