训练与微调

合集文章导航
本合集共 8 篇文章,涵盖大模型训练与微调全流程:
训练流程篇
- 大模型训练流程是什么? - 预训练、SFT、RLHF、DPO 全景
- 预训练到底在学什么? - 数据、目标函数和算力
微调技术篇
3. SFT 监督微调是什么? - 如何让模型学会按指令回答
4. LoRA 和 QLoRA 是什么? - 参数高效微调为什么省显存
5. RLHF 和 DPO 有什么区别? - 大模型偏好对齐
实践指南篇
6. 微调数据怎么构造? - 格式、质量、清洗和配比
7. 微调常见问题有哪些? - 过拟合、灾难性遗忘和幻觉
8. Prompt、RAG 和微调怎么选? - 什么场景适合微调
预训练、微调、RLHF……大模型到底是怎么炼成的?
你有没有想过一个问题?
ChatGPT、Claude、DeepSeek……这些AI助手为什么能说人话?它们不是生来就聪明的,背后是一套完整的"修炼"体系。就像一个人从懵懂无知到博学多才,大模型也要经过层层训练才能变得好用。
这个合集,就是要把大模型是怎么炼成的彻底讲清楚。我踩过不少坑才把这些搞明白,现在直接喂给你。
先搞清楚——训练和微调到底有什么区别?
很多刚接触AI的人容易把"训练"和"微调"混为一谈。
其实差别很大。
训练是从零开始造一个模型。就像盖一栋楼,要先挖地基、打框架、砌墙……整个过程耗时耗力。训练大模型需要用海量的文本数据,让模型从一无所知到学会语言规律。这个阶段消耗的算力和数据是惊人的——GPT-3训练一次要花几百万美元,用的数据够一个人读几辈子。
微调呢?微调是在已有模型基础上做定向培训。就像楼已经盖好了,你需要把它装修成适合办公的样子,或者改造成餐厅。这个过程不需要推倒重来,只需要在已有基础上做调整。
打个比方就清楚了:
预训练是建房子打地基,微调是装修。地基决定房子稳不稳,装修决定住着舒不舒服。两者缺一不可,但完全不是一回事。

训练的三部曲——预训练、SFT、RLHF
现在我们知道大模型要先训练再微调。
但训练本身也分阶段。
很多人不知道的是,从一个"能说话的语言模型"到"能有效回答问题的AI助手",中间要过三道关。这三道关就是:预训练、SFT、RLHF。
第一关:预训练——海量文本中自学语言规律
这个阶段,模型会把整个互联网的文本都看一遍。
不是理解,是"吞"。
就像小孩从小泡在大人说话的环境里,听多了自然会模仿。模型也是一样的道理——给它看万亿级的文本,它自己就能学会语法、常识、甚至一些推理能力。
这个阶段产生的是"基座模型"。它能续写文本,但不知道该怎么回答问题。你给它半句话,它会继续往下编,但不一定是你想要的答案。
第二关:SFT——监督微调,学会怎么回答
基座模型就像一个看了很多书但没受过教育的聪明人。
SFT就是来教它"该怎么回答"的。
这个阶段,人类会写大量的问答对:用户问什么、好的回答是什么。模型在这些例子中学习,逐渐掌握"被人问到这个问题时,应该这样回复"的模式。
经过SFT的模型,回答质量明显提升。但它可能还会有问题——比如回答太机械,或者在某些敏感话题上不知道该怎么把握分寸。
第三关:RLHF——对齐人类价值观
RLHF,全称是"人类反馈强化学习"。
名字很拗口,原理很简单。
模型生成的回复,由人类来打分。好的回答打高分,不好的打低分。模型学会了这个反馈,就会越来越倾向于生成高分回答。
这就像是请了一个严格的老师,专门纠正模型的"品德"——什么样的回答是有帮助的,什么样的回答可能有害。
现在主流还有DPO(直接偏好优化),是RLHF的简化版本,效果差不多,但训练起来更稳定。

微调的两条路——全量微调 vs 参数高效微调
好,现在模型训练完了,基座模型到手。
如果我想让模型在某个特定领域表现得更好,比如专精医疗、法律、或者客服,就需要微调。
微调有两条路:全量微调和参数高效微调。
全量微调
就是更新模型的所有参数。
效果最好,但门槛也最高。7B的模型要几十G显存,70B的模型要几百G显存。普通玩家的显卡根本跑不动。
就像你想让一匹马学会新技能,把整匹马都重新训练一遍。费时费力,但效果确实好。
参数高效微调(PEFT)
聪明人想了个办法:不用更新所有参数,只更新一小部分。
其中最流行的就是LoRA和QLoRA。
LoRA的核心思想是:冻结原模型的所有权重,只在旁边加两个小矩阵。每次训练时,只训练这两个小矩阵,最后把它们加到原模型上。
打个比方:你有一件很贵的西装,不想大改。那就在上面加个别针或者胸针,看起来完全不一样了,但改动微乎其微。
QLoRA是LoRA的升级版,还能更省显存。普通的LoRA要24G显存,QLoRA 8G就能跑。这下更多人都能玩得起了。

微调实战——数据构造与常见坑
说完了技术方案,聊聊实操。
我第一次做微调的时候,数据格式搞错了一个字段,调了两天才发现问题。所以这块真的得注意。
微调效果好不好,数据质量是核心。
数据构造的四个要点
第一,格式要对。不同模型对数据格式要求不同,乱格式会导致训练直接失败或者效果很差。
第二,内容要精。数据清洗这一步偷不得懒,那些网上随便扒的问答数据往往质量参差不齐,用之前最好人工抽检一遍。
第三,配比要合理。你的数据集里不同类型的问答比例要设计好,不然模型可能偏科严重。
第四,量要适度。不是越多越好,我见过有人拿几万条重复数据去训,结果过拟合了。有时候100条精选数据比10000条糙数据更有效。
三个大坑
第一个坑:过拟合。
模型不是在"学习",而是在"背答案"。训练集上表现完美,测试集上一塌糊涂。就像学生刷题刷魔怔了,遇到新题就不会了。
第二个坑:灾难性遗忘。
学了新技能,把老本事忘了。比如微调了一个客服模型,结果它连正常对话都不会了。这是因为训练时没注意保护原有能力。
第三个坑:幻觉。
模型一本正经地胡说八道。这不是微调能完全解决的问题,但高质量数据能降低幻觉发生的概率。

什么时候该微调?Prompt、RAG、微调怎么选?
看到这里你可能会问:我就想让模型在某个任务上表现更好,一定要微调吗?
不一定。
微调是成本最高的选择,优先考虑成本低的方案。
Prompt工程——零成本,适合通用场景。
通过优化提示词,让模型自己发挥能力。写好system prompt,加几个示例,效果可能就有明显提升。大多数场景先用这招。
RAG(检索增强生成)——适合需要最新知识的场景。
不动模型本身,通过外挂知识库让模型"看书"。模型回答时先从知识库里查资料,再组织答案。适合企业知识库、最新法规查询、实时股价这类需求。
微调——适合需要特定风格、领域能力的场景。
比如你想让模型用你公司的语气回复客户,或者掌握某个垂直领域的专业知识,这时候才需要微调。
怎么选?看任务类型。

看完合集你能做什么?
好了,概览讲完了。
我们从训练和微调的区别讲起,经历了预训练、SFT、RLHF这三道关卡,了解了全量微调和LoRA的差异,还知道了数据构造的要点和常见坑。
接下来的8篇文章,我们会逐个深入每个环节。你会知道预训练具体在训练什么语言能力,SFT的数据怎么构造,RLHF的奖励模型是怎么训练出来的,LoRA的参数怎么调……
每一篇都是理论加实战,有原理有代码。
读完这个合集,你就不再是AI的普通用户了。你能看懂模型为什么这样回答,能判断什么场景该用什么方案,甚至能自己动手微调一个模型。
大模型的训练方式也在进化。随着模型越来越大,训练成本越来越高,未来会有更多"小步快跑"的微调方案出现。你准备好了吗?
下一篇文章,我们就从训练流程开始深入:大模型训练到底分哪几个阶段?预训练、SFT、RLHF、DPO分别做了什么?它们之间是什么关系?
