Multimodal grounding in reinforcement learning for robotic navigation and manipulation using a global workspace architecture

Léopold Maytié · 2025

Ancrage multimodal pour l'apprentissage par renforcement pour la navigation et la manipulation robotiques utilisant une architecture insipré de l'espace de travail global La capacité à percevoir, intégrer et agir sur des informations provenant de multiples modalités sensorielles représente une caractéristique fondamentale des systèmes intelligents. Alors que les agents biologiques combinent de manière transparente les entrées visuelles, auditives, tactiles et autres pour naviguer dans des environnements complexes, les systèmes artificiels peinent à atteindre une intégration multimodale comparable, particulièrement en apprentissage par renforcement où les agents doivent apprendre des comportements optimaux par interaction environnementale. La perception multimodale présente des défis computationnels uniques au-delà de la simple fusion de capteurs. Chaque modalité sensorielle possède des dynamiques temporelles distinctes, des résolutions spatiales et un contenu sémantique devant être harmonisés pour créer des représentations cohérentes du monde. Les systèmes biologiques y parviennent via des architectures neuronales sophistiquées permettant la plasticité inter-modale, les mécanismes d'attention et le traitement hiérarchique. Le défi est complexifié par la nécessité d'apprendre des correspondances significatives entre modalités sans supervision extensive, exigeant des systèmes capables de découvrir et d'exploiter la structure sous-jacente des données multimodales. Agir dans des environnements multimodaux introduit une complexité supplémentaire : les agents doivent non seulement percevoir à travers multiples canaux mais aussi coordonner des actions affectant simultanément différentes modalités sensorielles. Chaque action génère une rétroaction multi-sensorielle ; par exemple, saisir un objet fournit simultanément des informations visuelles, tactiles et auditives. Ceci crée de riches opportunités d'apprentissage où les agents peuvent découvrir des relations inter-modales par exploration comportementale et apprendre des politiques intégrant les réponses à travers les modalités, adaptant leur comportement selon l'interaction complexe entre canaux sensoriels et dynamiques environnementales. Cette thèse aborde le défi critique de l'ancrage de multiples modalités pour l'apprentissage par renforcement multimodal en investiguant comment des informations sensorielles disparates peuvent être efficacement intégrées par des représentations partagées. S'inspirant des neurosciences cognitives, spécifiquement de la Théorie de l'Espace de Travail Global, nous proposons que l'intégration multimodale puisse être réalisée par un espace de travail centralisé facilitant la diffusion d'informations et l'attention sélective à travers les modalités. Cette approche fournit un cadre théorique pour comprendre comment la conscience humaine émerge de la compétition et coopération de sous-systèmes spécialisés, offrant des perspectives précieuses pour concevoir des agents multimodaux artificiels. Notre approche est structurée en plusieurs étapes. Nous commençons par implémenter et valider un modèle computationnel de l'Espace de Travail Global pour l'intégration multimodale, puis explorons comment les propriétés de diffusion de cette architecture peuvent améliorer l'apprentissage par renforcement dans des environnements multimodaux. Nous investiguons ensuite la combinaison de notre système avec un modèle du monde permettant à l'agent d'apprendre par imagination, et démontrons finalement des applications pratiques dans des scénarios robotiques réalistes guidés par des objectifs exprimés à travers différentes modalités. À travers cette exploration exhaustive, nous visons à établir la Théorie de l'Espace de Travail Global comme un cadre à la fois biologiquement plausible et computationnellement efficace pour créer des agents incarnés capables d'une compréhension et d'une action multimodales sophistiquées.

Read the paper · More papers on PaperTik