01 | PPO (Proximal Policy Optimization)¶ 约 73 个字 预计阅读时间不到 1 分钟 概述 ¶ PPO 是 OpenAI 提出的策略梯度算法,通过 clip 机制限制策略更新幅度,兼顾训练稳定性和样本效率。在 RLHF 中被广泛用于对齐大语言模型。 参考资料 ¶ Proximal Policy Optimization Algorithms ( 论文 ) Spinning Up - PPO (OpenAI) Was this note helpful? 感谢支持~ 感谢指出,欢迎提 issue 或发邮件反馈~