Uncertainty aware behavioral cloning using Bayesian Neural Networks
Sanjay Thakur · eScholarship@McGill (McGill) · 2019
L’utilisation de démonstrations pour apprendre des manoeuvres complexes est une technique pratique pour enseigner aux robots lorsque d’autres techniques telles que l’apprentissage par renforcement sont difficiles àmettre en oeuvre. Cependant, le monde est divers et partiellement observable, et générer des démonstrations dans toutes les situations possibles est dur. Par conséquent, la décision du robot sur la situation qu’il n’a pas vue est souvent erronée.Une ligne de solutions potentielles pour adresser ce problème de prise de décision incorrecte dans des situations observees pour la première fois commence par donner aux robots une notion de confiance dans leurs décisions. Dans ce travail, nous développons une telle technique en utilisant une méthode probabiliste basée sur les données.Plus précisément, nous utilisons un réseau de neurones bayésien pour générer une quantité peu coûteuse à obtenir pour que le robot puisse évaluer sa confiance afin de bien réussir dans une situation donnée. Ces différentes situations sont davantage liées au monde réel ence sens que les différences entre elles ne sont pas observables. Nous montrons l’évolutivité et la cohérence de notre approche sur de telles situations dans des domaines robotiques simulés et réels de grande dimension. En outre, nous montrons qu’une telle solution basée sur la confiance permet de prendre une decision éclairée en temps réel, afin d’ínvoquer potentiellement une stratégie de repli. Une stratégie de repli consiste á demander plus de données. Nous montrons de manière empirique que l’obtention de données uniquement àla demande entraîne une efficacité accrue des données. Ceci est crucial dans le monde réelcar les données sont chères et difficiles à obtenir dans le monde réel