Développement de méthodes à base de descripteurs locaux et apprentissage profond pour la reconnaissance du visage et des émotions faciales

Mohamed Kas · HAL (Le Centre pour la Communication Scientifique Directe) · 2021

Cette thèse porte sur le développement de nouveaux concepts de segmentation d'images et de classification de régions pour l'analyse d'images. Il s'agit de mettre en œuvre de nouveaux descripteurs, qu'ils soient de couleur, de texture ou de forme et proposer de nouvelles architectures d'apprentissage profond pour des applications liées à l'analyse faciale. Nous nous concentrons sur la reconnaissance faciale et la classification des expressions faciales.Notre thèse a débouché sur la proposition de nombreuses contributions liées à l'analyse faciale couvrant des architectures classiques et profondes.Nous avons contribué à la reconnaissance faciale tout d’abord par la proposition d’un descripteur local appelé Mixed Neighborhood Topology Cross Decoded Patterns. Notre descripteur de visage repose sur une nouvelle topologie de voisinage et une fonction de noyau avancée permettant en encodage efficace des caractéristiques liées à la personne. Nous avons évalué le système de reconnaissance faciale proposé à base du MNTCDP sur des bases de données connues de l'état de l'art, disposant de challenges, couvrant la diversité des individus, environnement non contrôlé, des conditions de fond et d'éclairage variables. Les résultats obtenus ont dépassé plusieurs résultats de l’état de l’art.Pour la deuxième contribution, nous avons relevé le défi de la reconnaissance faciale invariante aux poses (PIFR) en développant une méthode de génération d'images basée sur le Generative Adversarial Network, afin de générer une image frontale correspondant à une image en profil. Cette transformation rend la reconnaissance beaucoup plus facile puisque la plupart des bases de données de référence n'incluent que des échantillons de face frontale. Nous avons créé une architecture profonde de bout en bout, composé du GAN pour la génération des échantillons de profil et un classificateur basé sur ResNet pour l’identification de la personne à partir de son image frontale synthétisée. Les expériences, que nous avons menées sur une base de données adéquate, notamment en termes de chevauchement des individus entre la base de l’apprentissage et celle de l’évaluation, mettent en évidence une grande amélioration des performances du PIFR grâce à la génération d’images frontales du GAN.Nos contributions à la tâche de reconnaissance des expressions faciales (FER) couvrent à la fois des scénarios statiques (une image) et dynamiques (plusieurs images). Notre architecture pour FER avec le mode statique repose sur l'extraction de caractéristiques de texture et de forme à partir de points de repère du visage spécifiques qui présentent suffisamment d'informations pour détecter l'émotion dominante. Nous avons proposé un descripteur appelé Orthogonal and Parallel-based Directions Generic Query Map Binary Patterns pour extraire efficacement les caractéristiques texturales liées aux émotions à partir de 49 points de repère. Ces caractéristiques sont combinées avec celles à base de forme calculées à l'aide du descripteur HOG sur un masque binaire représentant l'interpolation des 49 points. La classification est réalisée via le SVM. Less performances obtenues sur cinq bases de données avec le protocole Leave One Subject Out ont démontré l'efficacité de l’architecture proposée par rapport à l’état de l’art. D'autre part, notre contribution relative à la FER avec le mode dynamique intègre un réseau LSTM pour encoder avec précision les informations temporelles avec un masque d'attention permettant de se concentrer sur les repères liés aux émotions et garantir la robustesse de la reconnaissance. Nous avons considéré quatre échantillons comme entrées représentant l'évolution de l'émotion jusqu'à son pic. Chaque échantillon est codé via une branche CNN et les quatre branches sont jointes par un bloc LSTM qui prédit l'émotion dominante. Les expériences menées sur trois bases de données pour FER dynamique ont montré que l'architecture CNN-LSTM profonde proposée dépasse l'état de l'art.

Read the paper · More papers on PaperTik