跳转至

02 | GRPO (Group Relative Policy Optimization)

71 个字 预计阅读时间不到 1 分钟

概述

GRPO DeepSeek 提出的改进版 PPO,通过组内相对比较替代价值函数(Value Function,消除了对 Critic 模型的依赖,显著降低 RLHF 的训练成本。

参考资料