大模型训练流程是什么?

大模型是怎么炼成的?
你有没有想过,ChatGPT、DeepSeek 这些 AI 助手是怎么从一堆代码变成"聪明"的对话机器的?
它们的训练过程,就像一个人从小学到大学再到职场培训的过程。每一步都在塑造不同的能力,今天我们就来聊聊这个"养成记"。
大模型训练不是一步到位的
很多人以为,训练一个大模型就是喂数据、跑模型、出来个成品。
但真实情况复杂得多。
现在主流的大模型训练分三个主要阶段:预训练、SFT、RLHF(或者 DPO)。每个阶段解决不同层面的问题,缺一不可。
打个比方,这就好像培养一个学生:
小学阶段,学生大量阅读,什么书都看,打下知识基础。中学校园里,学生专门学习解题方法、考试技巧。工作后,员工在导师的反馈下学习职场规则、为人处世。
预训练对应的是"小学",SFT 对应的是"中学",RLHF/DPO 对应的是"工作培训"。
这三个阶段不是必须全部完成的。但预训练是基础,没有它,后面的一切都是空中楼阁。

预训练——让模型学会"说话"的基础
预训练是整个训练流程的第一步,也是最关键的一步。
这个阶段,模型要在海量无标注的数据里自己摸索规律。数据量有多大?千亿级别的 tokens。相当于把整个互联网的文本都塞给模型看一遍。
模型在学什么?说白了就是"预测下一个词"。
你给它前半句话,它猜后半句该是什么。这不就是完形填空吗?没错,就是这么个简单任务。
模型在不断预测、不断修正的过程中,慢慢学会了语言的基本规则。语法、语义、世界常识,都在大量的阅读里自然习得了。
预训练的本质是"背书"。模型学的是知识,而不是技能。
它读了很多书,知道"太阳从东边升起",知道"水的沸点是100度"。但你问它"请帮我写一封邮件",它可能给你续写一段莫名其妙的话。
这就是预训练的局限性:它只会"续写",不会"对话"。
预训练提供的是"能力底座"。后续的微调都在这个基础上进行。没有预训练打下的基础,SFT 和 RLHF 都无从谈起。

SFT——把续写机器调教成对话助手
预训练完了,模型能做什么?续写文本。
你输入"今天天气真",它可能输出"今天天气真好"或者"今天天气真热"。但你输入"今天天气怎么样"然后回车,它大概率会接着你的话往下编,而不是回答你的问题。
这显然不够用。
SFT 就是来解决这个问题的。
SFT 的全称是 Supervised Fine-Tuning,翻译过来叫"监督微调"。这个阶段要用高质量的有标注数据:指令-答案对。
什么是指令-答案对?就是问答数据集。问题是什么,答案是什么,清清楚楚标好了。
模型在预训练里学到的是"这句话后面可能接什么"。在 SFT 里学的是"遇到这种问题,应该这样回答"。
SFT 的本质是"做题"。学生做题,不是为了背答案,是为了学会解题方法。模型做 SFT,也不是为了记住答案,而是学会指令遵循的能力。
这里有个重要提醒:SFT 阶段不要强行注入知识。
知识注入应该用别的方式——continue-pretrain。SFT 学的是格式和技能,不是新知识。很多人搞混了这两点。
SFT 数据要"质"不要"量"。DeepSeek 的 SFT 只用了 150 万条精选数据,效果就很好。堆数据量不如提升数据质量。
经过 SFT 之后,模型能干什么?回答问题、写邮件、做总结、翻译、编程……一个对话助手该有的能力,基本都有了。

RLHF/DPO——让AI更懂"人心"
SFT 之后,模型能回答问题了。但回答得好不好、对不对、安全不安全,这些怎么保证?
SFT 学的是"遇到问题怎么答"。RLHF 学的是"什么样的回答才是好回答"。
RLHF 的全称是 Reinforcement Learning from Human Feedback,翻译过来是"基于人类反馈的强化学习"。
它解决的是什么问题?模型可能输出有害内容,可能回答不符合人类价值观,可能答非所问还觉得自己很对。
怎么办?让人类来打分。
RLHF 的流程是这样的:首先训练一个奖励模型,让它学会判断"哪个回答更好"。然后用这个奖励模型来指导大模型优化。这个优化算法叫 PPO。
你可以理解为:学生写作业,老师不仅打分,还给出详细的改进意见。学生根据意见修改,循环往复,越写越好。
但 PPO 这个算法很复杂,训练不稳定,计算成本也高。
所以有人想了个更简单的方法:DPO。
DPO 的全称是 Direct Preference Optimization,直接偏好优化。不需要单独的奖励模型,直接用人类的偏好数据来优化模型。
效果差不多,流程简单多了。
我在实际项目里用过这两种方法。DPO 确实好上手,GPT-4.5、DeepSeek-V2 这些新模型都在用它。但说句实话,在一些复杂的对齐任务上,RLHF 的策略梯度方法有时候能学得更细致。关键还是看你的场景。
RLHF 和 DPO 的核心目标都一样:让模型输出符合人类价值观,更安全、更友好、更有帮助。
具体应用场景是什么?比如你问"怎么制作炸弹",AI 应该拒绝回答。你表达出轻生的念头,AI 应该温和地引导你寻求帮助。
这些能力不是 SFT 能教会你的。SFT 告诉你"遇到问题怎么答",RLHF/DPO 告诉你"什么该答,什么不该答,怎么答才合适"。

三种训练方式对比总结
说完了三个阶段,我们来横向对比一下。
数据要求不一样。预训练要"多",数据量决定模型见识有多广。SFT 要"精",几百条高质量数据顶得上几万条杂数据。RLHF 要"准",偏好数据的标注质量直接影响对齐效果。
计算成本差很远。预训练烧钱最多,跑几个月、砸进去几千张卡是常态。RLHF 次之,但也不便宜。SFT 相对便宜,几百张卡跑几天就能搞定。
学习目标各不相同。预训练学的是"语言能力和世界知识"。SFT 学的是"指令遵循和任务技能"。RLHF/DPO 学的是"人类偏好和价值观对齐"。
本质区别一句话概括:预训练是"读万卷书",SFT 是"拜师学艺",RLHF/DPO 是"社会毒打"。
如果你要训练一个通用大模型,三个阶段都得走。如果你是垂直领域应用,预训练底座选好后,SFT 做好了基本就够用。如果对安全性和价值观要求特别高,再加 RLHF/DPO。

预告:预训练到底在学什么?
大模型训练就像培养一个人才:预训练给了它语言和知识的基础,SFT 教会它如何正确地"做事",RLHF/DPO 则让它学会更好地"做人"。
三个阶段层层递进,共同塑造了我们今天看到的 AI 助手。
但你有没有想过:预训练阶段,模型到底是怎么从海量文本里学到知识的?它学的是单词接龙,为什么能学会常识和逻辑?数据是怎么筛选的?目标函数是怎么设计的?
这些问题,我下一篇文章会详细聊聊。
