Word Embedding Algorithms as Generalized Low Rank Models and their Canonical Form

Kian Kenyon-Dean · arXiv (Cornell University) · 2019

Les algorithmes de plongement lexical (word embedding) produisent des représentations de mots très fiables utilisées par les modèles de réseau neuronal dans une multitude de tâches de traitement automatique du langage naturel (TALN) (Goldberg, 2016). En tant que tel, il est impératif que les praticiens en TALN comprennent comment leurs représentations de mots sont produites et pourquoi elles ont un tel impact.Le présent travail de recherche présente le cadre Simple Embedder, généralisant les algorithmes de pointe de plongement lexical (y compris Word2vec et GloVe) dans le cadre de modèles généralisés de bas rang (Udell et al., 2016). Nous en déduisons que ces deux algorithmes tentent de produire des produits scalaires des (vecteur d’) embeddings qui approchent des statistiques d’information mutuelle ponctuelle (PMI) dans le corpus. Une fois posés dans le cadre Simple Embedder, la comparaison de ces modèles révèle que ces algorithmes de plongement ressemblent tous à une simple estimation du maximum de vraisemblance (MLE) de la PMI paramétrée par le produit scalaire (des embeddings). Cette estimation engendre notre nouveau modèle de plongement lexical, Hilbert-MLE, comme étant représentant canonique du cadre Simple Embedder.Nous comparons empiriquement ces algorithmes avec des évaluations sur 17 ense bles de données différents. Hilbert-MLE observe systématiquement la deuxième meilleure performance pour chaque évaluation extrinsèque (classification des nouvelles, analyse des sentiments, étiquetage morpho-syntaxique et étiquetage supersense), tandis que le meilleur modèle dépend de la tâche. De plus, Hilbert-MLE observe systématiquement la plus faible variance dans les résultats quant à l’initialisation aléatoire des poids dans les rèseaux LSTM bidirectionnels. Nos résultats empiriques démontrent que Hilbert-MLE est un algorithme de plongement lexical très cohérent pouvant être intégré de manière fiable dans les systèmes existants de TALN pour obtenir des résultats de haute qualité

Read the paper · More papers on PaperTik