Skip to content

A NON-exhaustive list of RL algorithms

rl algorithms_

Source : OpenAI - A non-exhaustive, but useful taxonomy of algorithms in modern RL

RL Algorithms descriptions

Monte Carlo

  • Every visit to Monte Carlo

Q-learning

  • State–action–reward–state

SARSA

  • State–action–reward–state–action

Q-learning - Lambda

  • State–action–reward–state with eligibility traces

SARSA - Lambda

SARSA - State–action–reward–state–action with eligibility traces

sarsa-algo

Open notebook in Colab

DQN Deep

  • Q Network

DDPG

  • Deep Deterministic Policy Gradient

A3C Asynchronous

  • Advantage Actor-Critic Algorithm

NAF

  • Q-Learning with Normalized Advantage Functions

TRPO

  • Trust Region Policy Optimization

PPO

  • Proximal Policy Optimization

TD3

  • Twin Delayed Deep Deterministic Policy Gradient

SAC

  • Soft Actor-Critic

RL Algoritms comparison

RL comparison

Src : RG - James T. Graham

Resources