On Deep Multiscale Recurrent Neural Networks

Chung, Junyoung · 2018

L’apprentissage profond a poussé l’étude des réseaux de neurones profonds et a conduit à des avancées significatives dans plusieurs domaines d’application de l’apprentissage automatique. Dans ce manuscrit, nous nous concentrons sur un sous- ensemble de ces modèles: les réseaux de neurones récurrents. La structure spécifique de ces réseaux fait de la modélisation de données temporelles, telles que les données textuelles ou de parole, leur point fort. Plusieurs domaines d’applications plus pratiques en font d’ailleurs leur composante essentielle, incluant la reconnaissance de parole, la synthèse de parole, la traduction automatique et l’apprentissage par renforcement. Cependent, notre compréhension des réseaux de neurones récurrents reste loin d’être complète, plusieurs problèmes spécifiques aux réseaux de neurones n’ont pas encore été r ésolus. Ce manuscrit inclut plusieurs pistes conduisant à des architectures de réseaux de neurones récurrents profond et multiéchelle. Dans un premier article, nous présentons un réseau récurrent pouvant contrôler son propre schéma de connectivité entre couches représentant des indices temporels consécutifs. Ces connexions entre temps consécutifs ne se limitent pas juste à des connexions sur un même niveau mais permettent à des couches de haut niveau de communiquer avec des couches plus basses, et vice-versa. Un ensemble d’unités barrage paramétriques est appris afin d’ouvrir ou de fermer les connexions qui conduisent le signal des couches précédentes temporellement. Nous étudions comment les informations des couches ascendantes sont utiles dans la modélisation de dépendences temporelles. Dans un deuxième article, nous étudions un système de traduction automatique neuronale reposant sur un décodeur par caractère. Ce travail est motivé par une question fondamentale: peut-on générer une suite de caractères en guise de traduc- tion au lieu d’une suite de mots? Afin de répondre à cette question, nous avons utilisé une architecture simple à deux niveaux et conçu un réseau de neurones plus complexe traitant les dynamiques rapides et lentes séparemment. Ce nouveau mo- dèle se base sur l’idée d’utiliser des composantes évoluants à différentes échelles afin de traiter les dépendences temporelles. Nous étudions dans un troisième article une architecture de réseau récurrent permettant la découverte des structures latentes d’une séquence. Cette nouvelle architecture s’appuie sur un ensemble d’unités limites permettant une segmentation en morceaux pertinents. Le réseau de neurones récurrent met à jour chaque couche cachée sur un rythme différent dépendant de l’état de ces unités limites. L’inclusion de ces unités limites nous permet de définir un nouveau mécanisme de miseàjour utilisant trois différents types d’opérations: chaque couche peut soit copier l’état précédent, mettre à jour cet état ou évacuer cet état vers l’état de plus haut niveau et réinitialiser le contexte. Enfin, un quatrième article se penche sur l’utilisation de variables latentes dans un réseau de neurones récurrent. La complexité et le rapport signal-bruit de données séquentielles comme la parole rendent la découverte de structures pertinentes dans ces données difficiles. Nous proposons une extension récurrente de l’auto-encodeur variationel afin d’introduire ces variables latentes et améliorer la performance dans la modélisation séquentielle, incluant celle de la parole et de l’écriture manuscrite.

Read the paper · More papers on PaperTik