预训练到底在学什么?

预训练到底在学什么?
上篇我们对大模型训练的全流程做了一个梳理。
预训练、SFT、RLHF、DPO,每个阶段各司其职。
就像电影分前传、正传、后传——先上学、再实习、最后正式上班。
但很多读者看完最想问的是:预训练阶段,模型到底学了什么?
这才是关键。今天就聊聊这个。
预训练有三个核心要素:数据、目标函数、算力。
预训练的本质:给模型"装"大脑
预训练的目标很明确:让模型学会语言理解和世界知识。
怎么学?方法很简单——猜词。
给模型喂海量文本,让它反复练习"根据上下文,猜下一个词是什么"。
比如模型读到"今天天气很",它要猜下一个词是"好"。
猜错了?调整参数再来。猜对了?继续保持。
就这么一个任务,做了万亿次之后,模型突然就"开窍"了。
它学会了语法结构、积累了大量常识、掌握了基本推理能力。
预训练结束后的模型,我们叫它"基础模型"或者"基座模型"。
这时候的模型知识量惊人,但不知道该怎么跟人交流。
就像一个天才少年——他读完了整个图书馆,但你问他问题,他可能会即兴创作一首诗,而不是直接回答你的问题。
预训练阶段的选择,决定了模型的上限。你喂多少数据、喂什么数据、用多大参数规模,都直接影响它能走多远。
Token化:AI理解语言的第一步
模型猜词之前,得先把文字切成小块。
这一步叫Token化,切出来的每个小块叫Token。
AI不像人类能一眼看懂整句话,它只能处理这些预先切好的Token。
举个例子,"今天天气很好"这句话:
- 按词切:今天/天气/很好 → 3个Token
- 按字切:今/天/天/气/很/好/好 → 7个Token
不同切法,Token数量不一样。Token数量直接影响计算成本。所以切分策略是个技术活。
好的切分能让模型学得更高效,坏的切分让模型学得费劲还效果差。
这就像学英语,用词根来记单词比逐个字母背高效多了。Token就是AI的"词根"。
两种学习方式:看完再猜 vs 从头续写
模型猜词的方式,现在主流有两种。
第一种:双向语言模型(MLM)
代表是BERT。它同时看一个词前后的所有上下文。
比如"今天天气很[ ],我想去公园散步"。
BERT能同时看到"天气"和"散步",综合两边信息填出"好"。
这就像完形填空——你看完整段话再填答案。
理解能力强,但不会续写。
第二种:单向自回归模型(AR)
代表是GPT系列。它只能根据前面的词猜下一个。
读到"今天天气很",它只能从"很"往后猜。
它不知道后面是"好"还是"不错"还是"糟糕"。
这就像根据上文续写作文——只能往前写,不能回头看答案。
生成能力强,但"视野"只能往前看。
BERT和GPT,一个看完再猜,一个从头续写。没有绝对优劣,取决于你想让模型干什么。
涌现能力:量变引发质变的"开窍"时刻
大模型有个神奇现象:涌现。就是模型规模变大后,突然出现了之前没有的能力。
我之前测试过一些模型,发现一个有意思的现象:
小模型做复杂推理的时候,经常犯低级错误。但模型大到某个规模,突然就能做对了。
小模型只能写简单的代码片段,大模型突然就能写一整个函数,甚至能 Debug。
这种能力不是线性渐变的,而是在某个临界点突然"开窍"。
就像小孩学说话:从蹦单词,到会说"妈妈抱抱",到能讲完整故事。中间似乎有个临界点,某天突然就突破了。
学术界对涌现的本质还有争议。有人认为是真的质变,有人认为只是评估指标的问题。
但有一点是确定的:模型必须先达到一定规模,才有可能碰到涌现的门槛。
数据为王:从3000亿到10万亿Token
预训练的数据量,增长速度惊人。
2019年的大模型,用3000亿Token训练。2025年的顶级模型,已经达到10万亿Token量级。
6年时间,增长了30多倍。
但数字不是唯一的衡量维度。数据质量比数量更重要。
我见过一些团队迷信"数据越多越好",结果喂了一堆重复内容、低质量网页,效果反而不如精心清洗过的数据集。
好的数据集就像精心搭配的膳食,差的数据集就像吃垃圾食品。长期来看,体质差异会很明显。
数据清洗主要包括:去重、去掉低质量内容、去掉有害内容。这一步往往比收集数据更费时费力。
另外,数据配比本身是个技术活。
代码数据多的模型,编程能力强。数学数据多的模型,解题能力强。学术论文数据多的模型,写作更专业。
预训练的数据配方,决定了模型的能力结构。
预训练 vs 后训练:聪明和听话是两件事
到这里,你可能会问:预训练完的模型,为什么不能直接用?
因为预训练和后训练解决的问题不一样。
预训练让模型"聪明"——学会语言和知识。
后训练让模型"听话"——学会按指令回答。
这是两件完全不同的事。
预训练就像培养一个天才:给他海量的书去读,让他学会知识和逻辑。但这时候他还不知道怎么跟人正常交流——你问他问题,他给你背书。
后训练就像教他职场礼仪:什么时候该直接回答,什么时候要委婉拒绝,怎么说才让人听着舒服。
后训练的技术包括RLHF(人类反馈强化学习)、DPO(直接偏好优化)等。
有意思的是,后训练效果惊人。InstructGPT用7B参数就能在人类偏好评测中超过175B的GPT-3。差了25倍的参数量,效果反而更好。
这说明什么?后训练的价值被严重低估了。
预训练决定模型的上限,后训练决定怎么发挥这个上限。
最后
预训练决定了模型的天花板在哪里。
它能理解多复杂的语言、掌握多少世界知识、拥有多大的潜力——全看预训练怎么做的。
但天花板高不代表好用。一个天才有巨大潜力,但不知道怎么在职场表现,你会觉得他有价值吗?
后训练就是教他职场礼仪,让潜力变成实用能力。
现在你跟AI对话时,可以想想:它的"聪明"来自预训练,它的"听话"来自后训练。这两步配合,才有了你面前的AI助手。
那具体怎么让模型学会"听话"呢?下一期我们就来聊——SFT监督微调,让模型从"天才"变成"助手"的那一步。
