RLHF 和 DPO 有什么区别?

RLHF 和 DPO 有什么区别?为什么大模型需要偏好对齐?
上回我们聊完了预训练、SFT、偏好对齐三阶段各解决什么问题。简单说就是:预训练学知识,SFT 学说话方式,偏好对齐学做人。
那偏好对齐具体怎么实现的?今天来看看两套主流方案。
1. RLHF:给AI请了个"私人教练"
RLHF 的全称是 Reinforcement Learning from Human Feedback,翻译过来就是"从人类反馈中学习强化学习"。
这个名字听起来有点绕。拆开来看,它本质上是把"人类觉得好还是不好"这件事,变成一个可以优化的目标。
RLHF 的训练分三个阶段:
第一阶段:监督微调(SFT)
先让模型在高质量问答对上学习,得到一个"听话"的基础模型。这一步我们在上一篇文章里讲过。
第二阶段:训练奖励模型(RM)
这是 RLHF 的核心创新。
人类标注员需要对同一问题的多个回答进行排序:哪个更好?哪个差点?
模型学习这些排序结果,就能理解什么是"人类认为的好回答"。
这就像教小孩认字时,你说"这个写得好,那个写得潦草"。说多了,他自己就知道什么算好字了。

第三阶段:用强化学习优化
有了奖励模型,AI就可以开始"自我提升"了。
它生成回答 → 奖励模型打分 → 根据分数调整策略 → 再生成 → 再打分……循环往复。
这就是 RLHF 的完整流程。
2. PPO:RLHF的强化学习引擎
说到强化学习优化,必须提到 PPO。
PPO 的全称是 Proximal Policy Optimization,中文叫"近端策略优化"。这个名字本身就透露了它的核心思想——"近端",意思是每次只挪一小步。
为什么不能大步走?
大步走可能导致模型突然"性格大变"。本来好好的,下一秒突然开始胡言乱语。
PPO 用了一个聪明的设计:裁剪机制(Clipping)。
简单说就是:限制每次更新的幅度。原来一步能走 0.5,现在最多走 0.1。宁可慢一点,也要稳。

类比一下:PPO 就像老司机教徒弟踩油门。不会让你一脚踩到底,而是慢慢加,学会一点再学下一点。
RLHF 加上 PPO,就像请了一个既懂得设定标准、又懂得循循善诱的教练。
3. DPO:绕过奖励模型,直接纠错
RLHF 听起来很完善对吧?但它有个明显的问题:太复杂了。
训练一个奖励模型,再跑强化学习,光调试就要花几个月。资源消耗更是惊人。
有没有更简单的方法?
有。这就是 DPO。
DPO 的全称是 Direct Preference Optimization,翻译过来就是"直接偏好优化"。
它的思路很直接:既然 RLHF 最后还是要让模型学会区分好和坏,为什么不直接教它?
DPO 不需要单独的奖励模型。它直接拿"好答案"和"坏答案"配对的数据,让模型学会区分。

打个比方:
RLHF 像传统教育:先出考试大纲,再刷题,再讲评。
DPO 像老师直接批改作业:这道对了,那道错了,你自己悟。
从技术上看,DPO 把原本的三步流程压缩成了一步。代码从几千行变成几百行,训练时间从几天变成几小时。
这就是为什么开源社区特别喜欢 DPO。
4. RLHF 和 DPO:两种路线的全面对比
同样是对齐,为什么业界会有两种完全不同的方案?它们各有什么优劣?

训练流程的差异
RLHF 需要三步:SFT → 训练奖励模型 → PPO 强化学习。每一步都可能出问题,调试成本高。
DPO 只有一步:用偏好对数据直接微调。简单是简单了,但调参难度反而更高。
稳定性的差异
这是关键分歧点。
DeepMind 的研究指出,RLHF 更稳健。原因在于它的显式正则化机制——PPO 的裁剪限制让模型不会突然跑偏。
DPO 缺少这层保护。直接微调虽然快,但在复杂场景下容易过拟合。模型可能记住了一些"正确答案",却丧失了对新问题的泛化能力。
适用场景的不同
闭源大厂(OpenAI、Google)倾向 RLHF。因为产品稳定性是生命线,出一次事故就能上热搜。
开源模型(Mistral、Llama)偏爱 DPO。资源有限,快速迭代更重要,出点问题社区一起修。
没有银弹
类比一下:RLHF 像是系统化驾校教育,严格但费时间。DPO 像是直接上路练车,快但不规范。
选哪个,取决于你的场景。
5. 大模型为什么必须做偏好对齐
讲了这么多技术细节,回到一个根本问题:为什么非要做偏好对齐?
预训练有"道德盲区"
大模型的预训练数据来自互联网。互联网上有什么?有偏见、有谣言、有恶意内容。
模型照单全收,学到了一肚子杂七杂八的东西。
不对齐的模型,就像一个天才少年没人管。能力越强,危害越大。
有些目标无法量化
什么是"有帮助"?什么是"安全"?什么是"有分寸"?
这些标准没法用简单的数学公式定义。你说不清楚,但人类标注员能判断。
偏好对齐就是用人的判断,来校准模型的行为。
对齐提升用户体验
没对齐的模型可能答非所问,可能说一些冒犯的话,可能给出有害建议。
对齐之后,模型能理解用户真实意图,回答更精准、更有分寸。
6. 产业实践:两条路线并行
目前业界的状态是:两条路线并行,各有各的地盘。

闭源阵营:RLHF 为主
ChatGPT、Claude、Gemini,这些主流产品用的都是 RLHF 或其变体。
原因很简单:稳定性第一。这些产品面向亿级用户,任何一次"翻车"都可能上新闻。
开源阵营:DPO 崛起
Mistral 7B、Llama 3,都采用了 DPO 或类似技术。
开源社区追求的是快速迭代、低成本实验。DPO 正好满足了这些需求。
未来趋势
两种路线还在互相借鉴。RLHF 在简化流程,DPO 在加强稳定性。
也许不久的将来,会有更优雅的方案出现。
训练完对齐模型后,你可能想让它适配到特定任务或硬件上。LoRA 就是解决这个问题的利器——它能大幅降低微调成本,让每个人都能训练自己的专属模型。
这背后又有什么原理?我们下回分解。
