Reward Modeling¶
约 115 个字 预计阅读时间不到 1 分钟
目标:学习人类对模型输出的偏好,生成奖励信号指导强化学习。
奖励模型(RM)¶
- 判别式 RM:输入回答,输出标量分数
- 生成式 RM:输出解释或评语,再映射为偏好信号
- 风险:奖励模型偏差会被策略放大(reward hacking)
flowchart LR
A[State\nCurrent LLM Context] --> B[Agent\nRL POLICY = LLM]
B -->|Action\nGenerate tokens| C[Environment]
C -->|Reward\nOutput from the reward model\nfor a {prompt, completion pair}| B
C --> A
Preference dataset:
需要确定你优化的目标到底是什么:是让模型更符合人类偏好,更安全?less toxic