02 | Bellman Equation¶
约 67 个字 1 张图片 预计阅读时间不到 1 分钟

\[
Q(s, a) = r(s, a) + \gamma \sum_{s' \in S} P(s' | s, a) V(s')
\]
DDPG: 深度确定性策略梯度
- 连续的动作空间
- 估计确定性策略,训练更快
critic 是帮助 actor 进行训练的,actor 是决定策略选择的
约 67 个字 1 张图片 预计阅读时间不到 1 分钟

DDPG: 深度确定性策略梯度
critic 是帮助 actor 进行训练的,actor 是决定策略选择的