大模型到底是什么?

大模型到底是什么?和传统AI模型有何本质区别?
你有没有想过,为什么ChatGPT能写诗、能编程、还能帮你分析数据,一个模型怎么什么都会?
而那些专门做翻译、做情感分析的AI模型,反而显得"只会一件事"?
这背后,其实是两种完全不同的AI范式在起作用。
今天我们就来搞清楚:大模型到底是什么?它和传统AI模型到底有何本质区别?
预测下一个词:大模型的本质
大语言模型的核心任务,其实就是一个——预测下一个词。
听起来很简单对吧?给你一句话的开头,让模型猜下一个字是什么。
比如输入"今天天气真",模型输出"好"。
然后把"好"加进去变成"今天天气真好",继续预测下一个词。
大模型就是这样,一个字一个字地往后猜,直到写完一整段话。

这个最小单元在AI领域有个专门的名字——Token。
Token可以是一个字、一个词,甚至一个标点符号。
GPT-4处理中文时,一个Token大约等于0.5到1.5个汉字。
看起来智能的对话、写作、推理,其实都是"一个字一个字往后猜"这个简单机制的涌现。
这就像考试时的完形填空题,但大模型面对的是整个互联网的文本,填了几万亿次之后,它居然学会了语法、逻辑甚至常识。
它不需要被告知什么是主谓宾,什么是因果关系,在预测下一个词的过程中,这些知识自然就被掌握了。
"大"字背后:参数、数据、算力的三角游戏
大模型之所以叫"大"模型,到底大在哪里?
首先是参数规模大。
所谓参数,你可以简单理解为模型的"脑细胞"数量。
BERT有3.4亿参数,GPT-3有1750亿参数,Google的PaLM有5400亿参数。
这些数字是什么概念?
如果把BERT的参数打印出来,纸张叠起来能有34层楼那么高。
GPT-3的参数打印出来,够堆出地球到月球距离的一半。

其次是训练数据大。
Llama 3的8B模型用了15万亿Token训练。
15万亿是什么概念?
一个人一辈子读的书加起来大概也就5亿字左右。
一个8B的小型大模型,训练量相当于三万个普通人一生的阅读量。
传统NLP模型呢?
BERT用了33亿词训练,只有Llama 3的千分之一。
学术界有个重要发现叫Scaling Laws——规模定律。
这条定律说:参数、数据、算力按比例同步放大,模型效果会沿幂律曲线提升。
简单说就是:往模型里塞更多参数、喂更多数据、用更强算力训练,效果就会稳定变好。
这就像培养一个孩子,读完整个图书馆所有书的,和只读完几本教科书的,理解世界的深度完全不在一个层次。
Transformer:让"大"成为可能的核心架构
参数多、数据大,为什么传统深度学习模型做不到?
因为缺少一个关键突破——Transformer架构。
Transformer是当前所有大模型的基石。
它的核心是自注意力机制。
什么是自注意力?
传统模型处理一句话时,是一个字一个字顺序处理的,就像人排队打饭。
自注意力则让模型能"一眼看到"整句话甚至整篇文章,每个词和其他所有词都能直接建立联系。
一个词是主语还是宾语,和哪个词有因果关系,瞬间就能把握。
这解决了传统模型的一个致命问题——长距离依赖。
比如"因为今天下雨,所以"后面要填什么,"下雨"和"所以"之间隔了十几个字,传统模型很难记住这么远的关联。
但自注意力让模型可以同时关注文本中的任何位置,距离不再是问题。

Transformer有两个核心组件:编码器和解码器。
编码器负责理解输入,解码器负责生成输出。
BERT只用编码器,是"理解型"选手。
GPT系列只用解码器,是"生成型"选手。
这个架构的选择,直接决定了模型的能力和特点。
从BERT到GPT:判别式与生成式的分水岭
理解了Transformer之后,我们来看两个标志性的模型流派。
BERT是预训练的先驱。
它的训练方式很像完形填空:随机遮住句子中的某些词,让模型根据上下文去猜。
"今天天气真[MASK]好"——模型猜出被遮住的是"晴"。
BERT在各种理解任务上表现优异:分类、问答、命名实体识别。
但它有个局限——它是判别式模型。
每个任务都需要专门微调,用标注数据训练,才能在特定任务上表现好。
翻译有翻译的模型,情感分析有情感分析的模型。
GPT走的是另一条路。
它的训练方式是预测下一个词:给你"今天天气真",猜"好"。
这个看似简单的任务,其实要求模型具备全面的语言能力。
GPT不需要针对每个任务微调,直接输出文本就能完成各种任务。
写代码、分析数据、创作小说——同一个模型,全部搞定。

BERT开启了预训练时代,功不可没。
但GPT的生成范式,才是今天大模型的终极形态。
从BERT到GPT的发展,像是从"做选择题的高手"进化到"写论文的专家"。
判别式模型告诉你这个东西是什么,生成式模型直接给你想要的内容。
涌现能力:量变如何引起质变
大模型最神奇的地方,在于它会出现"涌现能力"。
所谓涌现,就是当模型规模超过某个临界点,突然就具备了之前没有的能力。
数学推理是个典型例子。
研究者测试了不同规模的模型做数学题:
参数规模在80亿以下的模型,做两位数乘法几乎全错,准确率接近零。
参数规模到5400亿的PaLM,准确率突然跳到60%以上。
这不是线性的、逐渐的提升。
而是达到临界点后,性能突然跃升。

另一个典型的涌现能力是上下文学习。
你有没有注意到,ChatGPT可以根据你给的几个例子,学会一种全新的任务?
你给它三个英文到中文的翻译示例,再给它一个新句子,它就能正确翻译。
这个能力在训练时没人专门教过它。
模型规模越大,这种涌现能力出现得越明显。
就像堆积木,堆到一定高度后,结构突然变得更稳定,能承受更多重量。
量变引起了质变。
这解释了一个困惑:为什么大模型能做的事情,似乎远超训练目标?
因为在追求"预测下一个词"这个简单目标的过程中,更大的规模自然涌现出了更复杂的能力。
三种AI模型的核心差异
说了这么多,大模型和传统模型到底有什么本质区别?
我们来做个全面对比。
传统NLP模型是一事一议的专家:翻译模型只会翻译,客服模型只会问答,每个任务都需要专门训练。
BERT是预训练的开创者:通过大规模无标注数据预训练,再用少量标注数据微调,仍然是针对每个任务做适配。
大模型则是一个全能选手:通过Prompt提示,就能完成各种完全不同的任务。

这背后有三点核心差异。
能力来源不同:传统模型靠显式训练教会每个能力,大模型靠涌现——规模大了之后,能力自然出现。
任务适配方式不同:传统模型需要微调,用标注数据再训练;大模型用Prompt,直接告诉它要做什么。
输出范式不同:传统模型输出分类标签、实体标签,大模型直接输出自然语言。
用一个生活类比来理解:
传统AI就像一个只会做一道菜的厨师,给他一千万个鸡蛋,他就做一千万个煎鸡蛋,换个菜式完全不会。
大模型呢?给它一份菜谱,它就能做出新菜。给它几个翻译例子,它就能翻完全新的句子。
这就是"通用能力"的含义——不需要针对每个任务重新训练,而是能举一反三、触类旁通。
下一章预告
大模型之所以"大",不只是参数多、数据量大,更在于这种规模化带来了质变——涌现出了通用智能的雏形。
但大模型的核心架构Transformer有多种变体,编码器、解码器、全架构各有特点。
为什么现在主流大模型几乎都选择了Decoder-only架构?
这背后有什么必然性?
我们下一篇接着聊。
