An evaluation of reinforcement learning performance in the iterated prisoner’s dilemma
Yifan Sun · Theoretical and Natural Science · 2023
This paper uses recurrent neural network-based reinforcement learning to play Iterated Prisoner’s Dilemma against different game theory strategies. Multiple experiments are carried out to compare the performance of the reinforcement learning agents, e.g., RL-agent vs. Tit for Tat, RL-agent vs. Grudge, RL-agent vs. Tit for Tat then Defect, RL-agent vs. Cooperate or Defect. It shows that both DQN and PPO agent would receive the highest reward by playing against a Tit for Tat agent in Iterated Prisoner Dilemma. Furthermore, DQN agent would perform better, by receiving higher mean episode reward compared to PPO agent.