Comment apprendre son espace de travail global ? Évaluer et apprendre efficacement des représentations multimodales
Benjamin Devillers · theses.fr (ABES) · 2022
Lors de l'apprentissage du monde, les entrées peuvent prendre toutes sortes de formes : images lorsque nous regardons autour de nous, texte décrivant des objets et leurs propriétés, sons lors de conversations, etc. La plupart de ces entrées ne sont pas annotées et se rejoignent de manière asynchrone pour construire une représentation commune du monde extérieur. Avec l'avènement récent de l'apprentissage contrastif, les modèles multimodaux de pointe s'appuient fortement sur l'occurrence naturelle de données synchrones en ligne : médias sociaux, Wikipédia, sites de discussion, communautés artistiques, site d'actualités, etc., où les utilisateurs peuvent publient des publications multimodales avec notamment du texte et des images. Ces données sont produites par des humains, pour des humains, supposés avoir des connaissances préalables pour comprendre les publications (par exemple, vocabulaire argotique, références à l'histoire et à l'actualité, culture générale, ou connaissance interne de communautés spécialisées). Avec les récentes percées dans la façon dont les puces informatiques spécialisées dans l'optimisation (GPU, TPU...) sont construites et utilisées, de très gros modèles ont laissé le monde étonné par leurs capacités. De plus, leur plein potentiel n'est pas totalement connu et de nombreuses évaluations et analyses seront nécessaires pour découvrir toutes leurs aptitudes. Alors que ces modèles reposent uniquement sur la disponibilité d'annotations en ligne, les données non annotées sont facilement disponibles sous toutes les formes (image, vidéo, son, texte, etc.) et pourraient être utilisés comme source d'information supplémentaire. En parallèle, les neuroscientifiques étudient le cerveau depuis plusieurs décennies, et les théories cognitives, justifiées par des études expérimentales, sont une précieuse source d'inspiration pour la recherche en intelligence artificielle. En particulier, la théorie de Bernard Baars sur l'espace de travail global a récemment gagné en popularité et donné un aperçu d'une méthode d'intégration multimodal. Dans cette thèse, nous présenterons d'abord les bases de l'apprentissage multimodal, puis nous nous concentrerons sur les réseaux multimodaux déjà existants, et verrons comment ils se comparent aux réseaux unimodaux en termes de généralisation. À la lumière de ces résultats, nous nous inspirerons de la théorie cognitive Global Workspace pour concevoir une méthode d'apprentissage multimodal semi-supervisé, qui nécessite moins d'annotations que les méthodes précédentes tout en donnant des performances équivalentes.