跳转至

RL

367 个字 12 行代码 预计阅读时间 2 分钟

损失函数设计:直接优化偏好数据对(yw≻yl,通过构造基于 Sigmoid 的对比损失,使模型更倾向于生成 yw

  • 优势:无需显式训练奖励模型,计算效率更高,避免奖励模型偏差导致的“奖励投机”问题。阶段价值:通过强化学习将人类偏好嵌入模型,显著提升模型的安全性、准确性和用户满意度(如 ChatGPT 的对话质量优化

偏好建模

  • 偏好数据常用 pairwise 形式(A 优于 B
  • BT 思想:将“谁更好”转成概率建模
  • 局限:真实偏好可能不满足传递性,存在循环偏好

RLHF

将人类偏好量化成为标量的奖励,让模型学会拒绝回答等复杂行为

PPO (Proximal Policy Optimization)

经典强化学习方案,效果稳定但成本高

流程长、标注成本高、超参数敏感、训练不稳定

model weights updated via PPO

  • Deep reinforcement learning from human preferences
  • training language models to follow instuctions with human feedbac

2 datasets

  • preference dataset
    {
        "prompt": "What is the capital of France?... [summary]:",
        "completion_0": "Paris",
        "completion_1": "London"
        "preference": "1"
    }
    
  • prompt dataset
{
    "key":
    values:{
        "wawea;klfs ja[summary]:",
    }
}

选择

成本高、周期较长

DPO (Direct Preference Optimization)

直接偏好优化,核心思想是将偏好学习转化成为一个分类问题,通过损失函数直接让“优胜”回答概率更大“劣胜”回答概率更小

训练速度 3 倍以上,数据少、算力成本低

不需要 RM 和采样

GRPO

组内比较候选输出,降低训练开销