跳转至

强化学习 | Reinforcement Learning

304 个字 预计阅读时间 1 分钟

强化学习的目的是得到最优策略

基本概念

  • 状态 \(s\): state
  • 动作 \(a\): action
  • 策略 \(\pi(a|s)\): 状态 \(s\) 采取什么样动作
  • 奖励 \(r\)
  • 轨迹:状态 - 动作 - 奖励 链条
  • 回报 return 可以评价策略的好坏
    • 折扣回报 \(G\)
  • 状态值 \(v_\pi(s)=\mathbb{E}[G_t|S_t=s]\)
    • 状态值依赖状态以及策略
    • 状态值是从一个状态出发能获得的回报的期望
  • 动作值:当前状态 \(s\),执行动作 \(a\) 之后,遵循策略 \(\pi\) 能够获得的期望回报

比如成功拿到了腾讯的 offer,那么“腾讯工作”这个状态的潜在价值就是未来各种可能工作的收益期望。 那动作价值呢,是指现在在腾讯工作了,假设发生跳槽动作,比如跳槽去一家创业公司,这个跳槽动作带来的潜在价值。那这个动作价值呢,又包含了即时奖励(比如创业公司给开年薪 300 万),和入职创业公司以后的状态价值 (比如创业公司会上市,股票会升值)。 —— HashFury 知乎

参考资料