跳转至

Reward Modeling

115 个字 预计阅读时间不到 1 分钟

目标:学习人类对模型输出的偏好,生成奖励信号指导强化学习。

奖励模型(RM)

  • 判别式 RM:输入回答,输出标量分数
  • 生成式 RM:输出解释或评语,再映射为偏好信号
  • 风险:奖励模型偏差会被策略放大(reward hacking)
flowchart LR
    A[State\nCurrent LLM Context] --> B[Agent\nRL POLICY = LLM]
    B -->|Action\nGenerate tokens| C[Environment]
    C -->|Reward\nOutput from the reward model\nfor a {prompt, completion pair}| B
    C --> A

Preference dataset:

需要确定你优化的目标到底是什么:是让模型更符合人类偏好,更安全?less toxic