RL¶
约 367 个字 12 行代码 预计阅读时间 2 分钟
损失函数设计:直接优化偏好数据对(yw≻yl
- 优势:无需显式训练奖励模型,计算效率更高,避免奖励模型偏差导致的“奖励投机”问题。阶段价值:通过强化学习将人类偏好嵌入模型,显著提升模型的安全性、准确性和用户满意度(如 ChatGPT 的对话质量优化
) 。
偏好建模 ¶
- 偏好数据常用 pairwise 形式(A 优于 B)
- BT 思想:将“谁更好”转成概率建模
- 局限:真实偏好可能不满足传递性,存在循环偏好
RLHF¶
将人类偏好量化成为标量的奖励,让模型学会拒绝回答等复杂行为
PPO (Proximal Policy Optimization)¶
经典强化学习方案,效果稳定但成本高
流程长、标注成本高、超参数敏感、训练不稳定
model weights updated via PPO
- Deep reinforcement learning from human preferences
- training language models to follow instuctions with human feedbac
2 datasets
- preference dataset
{ "prompt": "What is the capital of France?... [summary]:", "completion_0": "Paris", "completion_1": "London" "preference": "1" }
- prompt dataset
{
"key":
values:{
"wawea;klfs ja[summary]:",
}
}
选择 ¶
成本高、周期较长
DPO (Direct Preference Optimization)¶
直接偏好优化,核心思想是将偏好学习转化成为一个分类问题,通过损失函数直接让“优胜”回答概率更大
训练速度 3 倍以上,数据少、算力成本低
不需要 RM 和采样
GRPO¶
组内比较候选输出,降低训练开销