跳转至

02 | Bellman Equation

67 个字 1 张图片 预计阅读时间不到 1 分钟

image

\[ Q(s, a) = r(s, a) + \gamma \sum_{s' \in S} P(s' | s, a) V(s') \]

DDPG: 深度确定性策略梯度

  • 连续的动作空间
  • 估计确定性策略,训练更快

critic 是帮助 actor 进行训练的,actor 是决定策略选择的