Towards adversarial robustness of feed-forward and recurrent neural networks
Qinglong Wang · 2020
Les dernières années ont été marquées par la résurgence réussie de réseaux de neurones grâce à la recherche en apprentissage profond. Alors que le développement du réseau profond de neurones (RPN) continue pour atteindre les branches multiples de la recherche, y compris la vision par ordinateur, le traitement du langage naturel, et la détection de malware, il a été trouvé que la vulnérabilité de ces modèles puissants est tout aussi impressionnante que leur capacité dans les tâches de classification. Surtout, la recherche sur le problème exemple contradictoire relève que RPN, quoique puissant quand ils sont confrontés aux échantillons légitimes, souffrent sévèrement des exemples contradictoires. Ces exemples synthétiques peuvent être créés en modifiant légèrement des échantillons légitimes.Nous supposons que cette vulnérabilité pourrait entraver considérablement l’adoption massive de RPN dans des domaines critiques pour la sécurité.Cette thèse vise à comprendre des mystères de cette vulnérabilité de RPN, et à concevoir des cadres génériques et des algorithmes réalisables pour protéger RPN avec architectures différentes contre les attaques armées par des exemples contradictoires. Tout d’abord, nous explorons de manière approfondie les recherches existantes pour expliquer l’omniprésence des exemples contradictoires. Nous unifions les hypothèses soulevées dans les travaux existants en extrayant trois facteurs déterminants, c’est-à-dire, les données, le modèle et la formation. Ces facteurs sont également utiles pour localiser les différentes méthodes d’attaque et de défense proposées dans le spectre de la recherche, et pour analyser leur efficacité et limite.Ensuite, nous effectuons deux axes de recherche sur les réseaux de neurones avec des architectures feedforward et récurrentes, respectivement. Dans le premier axe, nous nous concentrons sur la robustesse antagoniste des feedforward réseaux de neurones, qui ont été largement appliqués au traitement des images. Dans le cadre générique que nous proposons, nous concevons deux types de feedforward réseaux qui peuvent résister contre les contradictoires, affaiblissent le pouvoir destructeur des exemples contradictoires et empêchent même leur création. Nous validons théoriquement l’efficacité de nos méthodes et démontrons empiriquement qu’elles renforcent considérablement la robustesse antagoniste d’une RPN et, en même temps, maintiennent une grande précision de classification. Notre deuxième axe d’étude met l’accent sur la robustesse antagoniste du réseau récurrent de neurones (RRN), qui représente une variété de réseaux typiquement utilisés pour le traitement de données séquentielles. Nous développons un cadre d’évaluation et proposons d’évaluer quantitativement la robustesse antagoniste de RRN avec des automates finis déterministes (AFD), qui représentent des règles rigoureuses et peuvent être extraits des RPN, ainsi qu’une métrique de distance appropriée pour les chaînes. Nous démontrons qu'il est possible d’utiliser les AFD extraites comme les règles en effectuant des prudents études expérimentales afin d’identifier les conditions importantes qui affectent les performances d’extraction. De plus, nous établissons théoriquement la corrélation entre différents RRN et différents AFD, et validons empiriquement cette corrélation par l’évaluation et la comparaison entre différents RRN pour leurs performances d’extraction. Finalement, nous développons un algorithme dans notre cadre et réalisons une étude de cas pour évaluer la robustesse antagoniste de différents RRN sur un ensemble de grammaires régulières