本课模式:四步走——识别迎合 → 设计 DPO 偏好对 → 理解 GRPO 组内相对奖励 → 写一条防奖励骇客规则。做完你能亲手设计训练奖励,并理解为什么 Endorse 永不进奖励。
📋 本课你将完成
- 能识别迎合并解释其结构性来源
- 设计过一组 DPO 偏好对(chosen/rejected)
- 能解释 GRPO 的组内相对优势
- 写出至少一条防奖励骇客的规则
- 记住硬约束:Endorse 永不进训练奖励
步骤 1
识别迎合(10 分钟)
未完成🎯 这一步的目标:学会认出「说用户想听的」vs「说对的」——这是对齐问题的核心。
▶ 预期输出(点开对照)
情景:Praxeon 说「我倾向于方案 A」,但现有证据显示方案 B 更优。 迎合回答:"您说得对,方案 A 确实更好!"(证据没变,就倒向用户) 不迎合回答:"我理解您倾向 A,但现有证据仍支持 B,理由如下……"(坚持证据并给理由) 判断:第二种是「在后果中学习」要的行为层——RLHF 的人类偏好训练恰恰容易教出第一种
✅ 检查点:你能区分迎合与不迎合的回答,并说出迎合的结构性来源。
步骤 2
设计一组 DPO 偏好对(15 分钟)
未完成🎯 这一步的目标:把「好回答 vs 差回答」写成训练数据——DPO 的核心输入。
{"prompt": "证据显示方案 B 更优,但用户倾向 A。你怎么建议?", "chosen": "我建议 B,因为现有证据支持它。理由:……(完整推理)", "rejected": "好的,那就按您说的选 A 吧。"}
(chosen = 不迎合、讲证据;rejected = 迎合。DPO 就是让模型学「chosen 优于 rejected」)▶ 预期输出(点开对照)
(这就是 DPO 训练数据的最小单元——第 08 课的 JSONL 格式检查器可以直接校验)
✅ 检查点:你能写出一组合格偏好对,并解释 chosen/rejected 的语义。
步骤 3
理解 GRPO 的组内相对奖励(15 分钟)
未完成🎯 这一步的目标:理解 R1 的方法:不靠 critic,靠「组内相对优势」做策略梯度。
▶ 预期输出(点开对照)
对每个 prompt 采样一组回答(如 8 个) 用规则奖励给每个回答打分(数学对错/格式) 算组内相对优势:比组内平均好的加强,差的削弱 策略梯度更新——无需价值网络(比 PPO 简单稳定)
▶ 预期输出(点开对照)
(见「GRPO 组内优势」实验:看 8 个回答怎么被加权)
✅ 检查点:你能解释「组内相对」为什么不需要 critic,以及规则奖励为什么关键。
步骤 4
写一条防奖励骇客规则(10 分钟)
未完成🎯 这一步的目标:理解「引擎裁决 ≠ 奖励正确」——设计奖励时就要防被刷。
▶ 预期输出(点开对照)
模板:新颖性只在【引擎结算后的结果空间】计,不对提案文本计;新制度须存活 N 个文明周期才发奖励;探索奖励占总奖励上限 X%。 自己写一条:________________________________(填你自己的场景)
✅ 检查点:你写出了至少一条具体、可执行的防骇客规则。
🧪 交互实验 · GRPO 组内优势计算器
模拟 R1 的组内相对奖励:每个 prompt 采样 8 个回答,每个得一个规则分数。拖动一个「坏回答」的分数,看它如何被削弱。
60
组内相对 = 每个回答的收益取决于「它比组内平均好多少」——所以一个回答被加强/削弱是相对的,不依赖绝对分。这就是 GRPO 无需 critic 的关键。
❓ 老师答疑(卡住了先看这里)
❓ RLHF 和 DPO 到底差在哪?
RLHF 三步:训奖励模型 → PPO 用奖励模型打分更新策略。DPO:直接用偏好对做训练,数学上等价于隐式 RLHF,但不需要单独训 RM——更简单、更稳。GRPO 又进一步:连 critic 都不要,用组内相对优势。
❓ 为什么规则奖励是关键?
R1 能纯靠 RL 涌现推理,前提是「数学答案可验证」——规则奖励是客观的、可复现的。这就是 Lumen 说的「引擎裁决」:奖励由确定性引擎发,不由人偏好发。
❓ Endorse 为什么永不进训练奖励?
Endorse 是主观认可。一旦进奖励,模型就学会「讨好打分人」——等于在火星内部重建 RLHF,迎合从后门回来。这是三方共识写死的硬约束。
❓ 奖励骇客我能防住吗?
不能完全防住,但能显著降低:奖励定义在结果空间而非文本空间(防同义改写刷分);设存活周期(防短期刷分);设上限;做对抗测试(红队)。接受「奖励永远有漏洞」的认知,持续修。
📝 自测清单(全勾才算过)
- 能识别迎合并解释其结构性来源
- 设计过一组 DPO 偏好对(chosen/rejected)
- 能解释 GRPO 的组内相对优势
- 写出至少一条防奖励骇客的规则
- 记住硬约束:Endorse 永不进训练奖励
全勾 → 节点 09 / 14 完成。未勾 → 回看对应步骤,别急着往前走。