Deep reinforcement learning for robot navigation systems
Tiago Alcântara Ribeiro · Portuguese National Funding Agency for Science, Research and Technology (RCAAP Project by FCT) · 2019
Aprendizagem Profunda Por Reforço Em Sistemas De Navegação Robóticos v Resumo A aprendizagem por reforço na robótica tem sido um tema desafiante dos últimos anos.A capacidade de equipar um robô com uma ferramenta tão poderosa, como permitir a descoberta, de forma autónoma, de um comportamento optimizador a partir de tentativa-erro, tem gerado inúmeros projetos de investigação.Esta dissertação apresenta os fundamentos teóricos de diferentes algoritmos de aprendizagem por reforço.Destes, três algoritmos distintos, nomeadamente Q-Learning, Monte Carlo Policy Gradient e Deep Deterministic Policy Gradient foram implementados em ambientes de controlo do OpenAI Gym.Os ambientes selecionados são MountainCar, CartPole e Pendulum, que garantem uma variedade de algoritmos implementáveis para diferentes espaços de estados e espaços de ações.De seguida, um agente simulado foi criado no V-REP e configurado via ROS e um nó de controlo em Python.O agente, Bot'n Roll ONE A, é um robô diferencial com sensores de distância embebidos.O objetivo do robô/agente é resolver três labirintos que aumentam de dificuldade utilizando os sensores de distância.Foram desenvolvidos testes com diferentes posições e orientações dos sensores e adicionados sensores Timeof-Flight.Dois algoritmos, Q-Learning e Monte Carlo Policy Gradient foram implementados no robô simulado.O Q-Learning permitiu a comparação entre dois métodos distintos no que toca a tempos de seleção das ações, em que um dos métodos conseguiu resolver os três labirintos utilizando os sensores embebidos.O método Monte Carlo Policy Gradient permitiu uma análise detalhada de como o sistema de recompensas influencia a política de ações aprendida.O Deep Deterministic Policy Gradient, ainda que não implementado no robô simulado, demonstrou um enorme potencial e vantagens essenciais, tais como a política de comportamento estocástica aliada a uma política alvo determinística, o método Actor-Crítico e a controlo de ações continuo.