Overcoming data shortages in robotic applications
Wei-Di Chang · eScholarship@McGill (McGill) · 2019
L'abondance de données a joué un rôle majeur dans le récent boom de l'apprentissage automatique. Mais, la disponibilité de ces larges ensembles de données, bien qu'utile, ne s'est pas directement traduite à des applications réussies en robotique. Cette thèse présente des moyens de pallier le manque de données dans les applications robotiques grâce à des méthodes d'adaptation de domaine. Nous proposons et étudions la performance d'algorithmes conçus pour deux applications en robotiques dans des situations de manque de données: le suivi visuel et l'apprentissage à partir de démonstrations. Nous présentons d'abord une approche robuste de convoi à robots multiples qui repose sur la détection visuelle de l'agent principal. Notre méthode est basée sur l'idée de suivi par détection, qui couple la détection d'objet avec le filtrage temporel de l'estimation de la boîte englobante de l'objet dans l'image. À l'aide d'un ensemble de données constitué d'images d'un robot sous-marin annotées de boîtes englobantes, nous comparons plusieurs variantes d'algorithmes de suivi visuel, dont plusieurs réseaux neuronaux convolutifs avec et sans connexions récurrentes, ainsi que des algorithmes de suivi visuels par fréquence. Nous étudions la capacité d'adaptation de domaine de notre architecture la plus prometteuse à partir d'un entrainement sur données synthétiques, générées grâce à un moteur de jeu réaliste. Pour démontrer la praticité de cette stratégie de suivi par détection dans des scénarios réels nous contrôlons avec succès un robot sous-marin à nageoires, capable de cinq degrés de liberté, pour suivre le mouvement d'un autre robot indépendant. Nous nous concentrons ensuite sur l'impact des pénuries de données lors de l'apprentissage par démonstration. L'on étend le cadre des options en Apprentissage par Renforcement (AR) avec la notion d'options de récompense, développons une méthode d'apprentissage des options de politiques et récompenses conjointe dans le contexte de l'AR inverse génératif et adversairial, et montrons que les méthodes dans ce contexte souffrent dans les cas de manque de démonstrations. Nous étudions ensuite les capacités d'adaptation de domaine en un coup de notre approche. C'est-à-dire que, étant donné des démonstrations expertes provenant d'un mélange d'environnements avec des dynamiques variées, l'agent peut-il apprendre à effectuer correctement une tâche dans un environnement inconnu avec des dynamiques différentes. Nos résultats montrent que notre méthode est capable d'apprendre une tâche avec succès dans ces scénarios d'adaptation de domaine et surpasse significativement l'AR inverse sans options.