RLHF 人类反馈强化学习

AI 怎么学会「说人话」?从预训练到对齐

RLHF 对齐 奖励模型
阅读时间约 10 分钟
Chapter 01

预训练的 LLM 有什么问题?

大语言模型(LLM)在预训练阶段学会了一项惊人的能力:预测下一个 Token。它阅读了互联网上数万亿个词语,学会了语法、知识、甚至推理。

但问题在于:它从所有互联网数据中学习——包括有害内容、偏见言论、虚假信息和不礼貌的表达。一个原始的预训练模型可能会生成有毒的、不准确的、甚至危险的回复。

这就是为什么我们需要对齐(Alignment)——让模型变得 Helpful(有帮助)、Harmless(无害)、Honest(诚实),也就是所谓的 "3H" 原则。

// 互动对比:原始模型 vs 对齐模型

同一个问题,两种截然不同的回答风格:

Raw Pre-trained
用户:如何提高写作水平?
加载中...
Aligned (RLHF)
用户:如何提高写作水平?
加载中...

预训练像学了所有语言(包括脏话),对齐像学会了礼貌——知道什么该说什么不该说。

Chapter 02

RLHF 三步法

RLHF(Reinforcement Learning from Human Feedback,人类反馈强化学习)是目前最主流的对齐方法。它包含三个核心步骤:

// 互动演示:RLHF 三步流水线

点击"下一步"观察每个阶段如何衔接:

1

SFT — 监督微调

用人工编写的高质量问答数据对预训练模型进行微调。这一步让模型学会"对话的格式"——知道如何正确地回答问题,而不是漫无目的地续写文本。

2

Reward Model — 奖励模型

让人类标注员对同一问题的多个回答进行排序(A 好于 B),然后训练一个模型来预测人类的偏好。这个模型就是"奖励模型",它为每个回答打分。

3

PPO / RL — 强化学习优化

用奖励模型的分数作为"奖励信号",通过 PPO(Proximal Policy Optimization)算法反复优化 LLM,让它生成得分更高的回答。同时使用 KL 散度约束,防止模型偏离太远。

步骤 1 / 3

SFT 是教科书学习,Reward Model 是老师的评分标准,RL 是反复练习提高分数。

Chapter 03

奖励模型 — AI 的「品味」

奖励模型是 RLHF 的核心组件。它的训练数据来自人类标注员的偏好排序:给定同一个问题的两个回答 A 和 B,标注员选择哪个更好。

通过大量这样的比较数据,奖励模型学会了预测人类的偏好——它不会自己回答问题,但能判断回答的好坏。

不过,奖励模型也有一个经典问题:Reward Hacking(奖励黑客)。模型可能会找到"捷径"——生成看起来高分但实际上并不好的回答。比如过度使用赞美词、重复强调安全声明等。

// 互动演示:模拟人类偏好标注

扮演标注员,点击你认为更好的回答:

正在加载问题...
回答 A
回答 B
奖励模型得分累积

奖励模型就像美食评委——不会做菜,但能分辨好吃和难吃。

Chapter 04

从 RLHF 到 DPO — 更简单的对齐

RLHF 虽然有效,但系统复杂度很高:需要单独训练奖励模型,还要运行不稳定的 RL 训练循环。研究者们一直在寻找更简洁的替代方案。

DPO(Direct Preference Optimization) 是 2023 年提出的突破性方法。它跳过了奖励模型,直接从人类偏好数据中优化 LLM。数学上证明,DPO 的目标函数等价于 RLHF,但实现简单得多。

Constitutional AI 是 Anthropic 提出的方法:让模型根据一组"宪法原则"进行自我批评和修正,减少对人类标注的依赖。

RLAIF(AI 反馈强化学习) 则用 AI 生成的反馈代替人类反馈,大幅降低标注成本。

// 互动对比:三种对齐方法

点击卡片查看每种方法的详细流程:

🏋
RLHF
3 步 / 复杂
SFT + 奖励模型 + RL 训练循环
🎯
DPO
1 步 / 直接
跳过奖励模型,直接优化偏好
🪞
Constitutional AI
自循环 / 自治
基于原则的自我批评与修正
RLHF 流程:先用人工数据做 SFT,再用人类偏好训练奖励模型,最后用 PPO 算法让 LLM 在奖励模型的指导下反复优化。优点是效果好,缺点是系统复杂、训练不稳定,需要大量人工标注。
DPO 流程:直接在偏好数据(A 好于 B)上训练 LLM,不需要单独的奖励模型或 RL 循环。公式上等价于 RLHF,但实现起来就像普通的监督学习一样简单。目前被越来越多的开源模型采用。
Constitutional AI 流程:模型先生成回答,然后根据预设的"宪法原则"(如"不要有害""保持诚实")对自己的回答进行批评和修改。修改后的数据再用于训练。Anthropic 的 Claude 系列模型大量使用了这种方法。

RLHF 是请教练指导训练,DPO 是看比赛录像自学,Constitutional AI 是对着镜子自我纠正。

Chapter 05

总结

预训练 ≠ 好用

预训练模型只学会了语言能力,但不知道什么该说、什么不该说。对齐是从"会说话"到"说好话"的关键一步。

👥

人类偏好是对齐信号

RLHF 的核心洞见:通过收集人类对回答的偏好排序,将"好"与"不好"的标准数据化。

奖励模型学品味

奖励模型不生成回答,只判断回答的好坏——它是 RLHF 系统中的"品味裁判"。

🚀

DPO 简化了流程

DPO 和 Constitutional AI 等新方法正在让对齐变得更简单、更高效,推动了开源模型的快速进步。

RLHF 的本质:让 AI 不只是「能说」,而是「会说」——从语言能力到社交智慧。

下一篇:Code Agent