跳转至

01 | PPO (Proximal Policy Optimization)

73 个字 预计阅读时间不到 1 分钟

概述

PPO OpenAI 提出的策略梯度算法,通过 clip 机制限制策略更新幅度,兼顾训练稳定性和样本效率。在 RLHF 中被广泛用于对齐大语言模型。

参考资料