强化学习 | Reinforcement Learning ¶
约 304 个字 预计阅读时间 1 分钟
强化学习的目的是得到最优策略
基本概念 ¶
- 状态 \(s\): state
- 动作 \(a\): action
- 策略 \(\pi(a|s)\): 状态 \(s\) 采取什么样动作
- 奖励 \(r\)
- 轨迹:状态 - 动作 - 奖励 链条
- 回报 return 可以评价策略的好坏
- 折扣回报 \(G\)
- 状态值 \(v_\pi(s)=\mathbb{E}[G_t|S_t=s]\)
- 状态值依赖状态以及策略
- 状态值是从一个状态出发能获得的回报的期望
- 动作值:当前状态 \(s\),执行动作 \(a\) 之后,遵循策略 \(\pi\) 能够获得的期望回报
比如成功拿到了腾讯的 offer,那么“腾讯工作”这个状态的潜在价值就是未来各种可能工作的收益期望。 那动作价值呢,是指现在在腾讯工作了,假设发生跳槽动作,比如跳槽去一家创业公司,这个跳槽动作带来的潜在价值。那这个动作价值呢,又包含了即时奖励(比如创业公司给开年薪 300 万),和入职创业公司以后的状态价值 (比如创业公司会上市,股票会升值)。 —— HashFury 知乎