大模型预训练目标是什么?

预训练目标:为什么"猜下一个词"能让AI学会一切
上回我们聊了LayerNorm和RMSNorm,说到底这些都是为了让模型训练更稳定。但你有没有想过:这些模型到底在学什么?它是怎么从一堆数学运算,变成一个"懂语言"的AI的?
答案藏在一个看似简单到离谱的任务里——预测下一个词。
什么是Next Token Prediction
先搞清楚什么是Token。
Token是文本的最小单位。英文里,一个Token可能是一个单词,也可能是一个单词的前缀。比如"running"可能被切成"run"和"##ning"。中文更简单些,基本就是一个汉字一个Token。
Next Token Prediction,简称NTP,就是让模型做"完形填空"。
输入:"今天天气真"
输出:"好"
模型需要根据左边的内容,猜出右边最可能跟着什么。

这听起来像小学语文题。但关键在于上下文可以非常长。
模型不是只看前一个词,而是看前面成百上千个词。有时候甚至要看一本书的内容,才能准确预测下一页会写什么。
想象你看一部悬疑剧。即使错过了一帧画面,你也能猜到接下来会发生什么——因为你从前面几十集积累了大量信息。NTP就是让模型具备这种能力:看过的越多,猜得越准。
BERT用的MLM(遮蔽语言模型)则是另一个思路:不是预测下一个,而是"猜中间"。
输入:"今天天气真[MASK]好"
输出:预测[MASK]应该是"真"
两种方法都能让模型学到语言规律,但走向了不同的应用场景。这个我们稍后展开。
为什么"猜词"能学到语言
你可能会问:光猜下一个字,怎么可能学会语法、学到知识?
这得从"压缩"说起。
语言的本质是pattern——重复出现的模式。好的预测意味着抓住了这些内在规律。
举一个生活中的例子。
你会背乘法表后,计算"7×8"很快。因为你记住了"七八五十六"这个规律,而不是把7个8相加算了八遍。
模型同理。
它不需要"记住"每句话该怎么写。背10000条"今天天气真好"的语料没用。模型要学的是:什么样的上下文后面最可能接什么词。
能准确预测,说明模型找到了语言里的压缩规律。

这里有一个惊人的数据。
LLaMA模型的压缩率约为14倍——也就是说,它能用1个bit表示原本需要14 bits才能表示的信息。这个数字超过了专门设计的压缩算法(Hutter Prize最佳成绩8.7倍)。
压缩率越高,说明学到的规律越多。
这背后有一个原理叫MDL(最小描述长度):能用越短的描述解释一个现象,说明你学到的规律越本质。
模型把语言压缩得越小,说明它对语言的理解越深。
预测即理解
现在我们深入一点,看看NTP背后的信息论原理。
NTP训练过程本质上是在做算术编码。
算术编码是什么?
它是一种信息压缩技术。核心思想是:给序列中的每个符号分配一个概率区间,符号越常见,区间越大。
模型在训练时,对输入序列进行动态编码。每预测一个词,就更新一次对后续内容的概率估计。
预测越准,编码越短。
最终,模型的预测能力会逼近香农熵——信息论里定义的理论极限。

这就解释了为什么"猜词"能学到知识。
准确预测下一个词,需要同时理解:
语法结构——"主谓宾"排列要正确
语义关系——上下文讲的是什么事
世界知识——"水开了"后面接什么才合理
比如你看到"水开了",大概率会预测"别烫着"或者"快关火"。
这个预测本身就证明你理解了"开水会烫伤人"这个物理常识。
没有任何人告诉模型这些规则。它是从海量文本里统计出来的——什么词后面最常跟着什么词,统计到最后,语法和知识就"涌现"出来了。
统计模式识别能自动推导出语言结构,无需显式规则。这很反直觉,但确实有效。
知识是怎么存进去的
你可能会问:模型学会了这些规律,知识到底存在哪里?
GPT的研究者发现,模型内部存在"知识回路"(knowledge circuits)。
不同的神经网络模块协同工作,存储和检索知识。问"法国的首都是"时,某些注意力头会被激活;问"巴黎是法国的"时,激活模式又不一样。
知识不是存在某个特定位置,而是分散在整个模型里。
还有一个重要机制:回路竞争(Circuits Competition Competition,CCC)。
模型越大,竞争的回路越清晰。什么是回路竞争?打个比方:
你大脑里有很多解题思路。做一道数学题时,你会无意识地激活最相关的几条,压制不相关的。
模型也一样。当需要输出"巴黎"时,"法国的首都"这条回路赢过"巴黎是NBA球队"这条回路。
规模增大后,回路表达更精细。就像从"模糊印象"变成"清晰记忆"。
这就解释了为什么大模型会出现"涌现能力"。
当回路竞争"突围"时,模型展现出意外的能力——比如突然会做数学题、会在代码里找bug。这些能力不是刻意设计的,是规模增长到一定程度后自然出现的。

争议:模型真的"理解"了吗
说到这里,必须提一下这个领域的核心争议。
LeCun和乔姆斯基认为:LLM只是学会了统计关系,并不真正理解语言。
他们提过一个"章鱼测试"的类比:
如果一只章鱼学会了用触手在水下传递信号,它能和人对话、回答问题。但它不理解语言的含义,只是模拟了外在行为。
类比到LLM:它能生成连贯的回答,但可能只是学会了"下一个词最可能是什么"的统计规律,并不理解自己在说什么。

另一派的观点来自OpenAI和Hinton。
他们指出:LLaMA的压缩率超过了专门设计的压缩算法。这说明LLM学到的不是表面的统计相关性,而是更深层的内在规律。
压缩率高,意味着模型找到了信息的本质结构。这种能力,已经超越了单纯的"统计拟合"。
核心问题变成:从外部行为判断,模型表现出理解;但模型内部是否真的"理解"?
这是一个哲学问题,也可能是一个没有标准答案的问题。
一个人能完美模仿另一个人的行为,和真正理解对方在想什么,确实是两回事。但我们怎么证明自己不是另一种"高级章鱼"呢?
NTP和MLM:两条不同的路
聊完争议,我们看看两种主要的预训练目标。
NTP我们已经很熟悉了:自回归生成,从左到右,一个词一个词往外蹦。
GPT系列走的就是这条路。
MLM(Masked Language Modeling)走的是另一条路:遮蔽预测。
输入一段话,随机遮掉几个词,让模型预测被遮的是什么。
BERT用的就是这个方法。

两种方法的差异决定了应用场景。
NTP天然适合生成任务。写文章、写代码、做对话,一个词接一个词往外写,正好匹配这种"从零开始生成"的需求。
MLM适合理解任务。做完形填空,两边都能看到,上下文信息更丰富,适合文本分类、问答这类"理解后判断"的任务。
GPT的成功证明了NTP的巨大潜力。
一个"猜下一个词"的任务,可以泛化到几乎所有语言任务上。写代码、翻译、对话、推理——都是从"预测下一个词"这个核心能力生长出来的。
这很神奇。一个看似简单的训练目标,催生了今天的大语言模型时代。
写在最后
从"预测下一个词"到学会语言和知识,NTP展现了一种优雅的智慧涌现方式。
它用最简单的方式,做了最复杂的事:让机器从海量文本中,自动发现语言的结构、知识的关联、推理的模式。
但这背后还有很多未解之谜。
模型内部是否真的"理解"了语言,还是只是表现得像理解了一样?回路竞争机制具体是怎么运作的?为什么规模增大后会涌现出意想不到的能力?
更重要的是:下一个能超越NTP范式的训练目标,会是什么?
理解了预训练,下一个问题自然浮现:预训练好的模型,怎么变成能对话的ChatGPT?这就是下一篇要聊的了。
