BERT 和 GPT 的核心区别是什么?

BERT 和 GPT:Transformer 分叉路上的两个"极端"
上篇聊完 Encoder-only、Decoder-only 和 Encoder-Decoder 三种架构的区别,你已经知道了它们的结构差异。但问题来了:既然都是 Transformer 变体,为什么 BERT 和 GPT 走向了完全不同的道路?一个在基准测试上称霸多年却逐渐式微,一个最初被嘲笑"没啥用"却掀起了 AI 革命?
这背后的故事,比技术细节有意思多了。
一、"全知视角"和"边想边说"的本质区别
先从架构说起。
BERT 用的是编码器。编码器的核心能力是:看到输入的所有信息,然后做理解和判断。就像你拿着一篇完整的阅读理解文章答题,你知道全部内容,可以从容分析。
GPT 用的是解码器。解码器的核心能力是:只看过去,预测下一个。就像你写作文,写完上一句才能想下一句,永远不知道后面会发生什么。
编码器模式下,每个位置的词都能"看到"整句话的所有其他词。这种双向注意力让 BERT 特别擅长理解任务——它能同时看到上下文的前后关系。
解码器模式下,每个位置只能"看到"之前的词。这是单向注意力,所以 GPT 天然适合生成任务——它就是在模拟人类说话的思维方式。

BERT 是"全知视角",拿到题目先通读全文再答题。
GPT 是"边想边说",说一句想一句,永远根据已知推断未知。
二、"做题家"和"创作者"的统计学本质
把架构差异翻译成更本质的东西。
BERT 是判别式模型,它学习的是条件概率 P(答案|问题)。给定输入,从预设的选项里挑最合适的。就像做选择题,正确答案是哪个就选哪个。
GPT 是生成式模型,它学习的是联合概率 P(词1, 词2, 词3...)。给定开头,从概率分布里一个词一个词地往外蹦。就像写命题作文,每个词都要"创作"出来。
判别式模型像什么呢?像考试的时候做选择题。看到题目,看选项,选答案。你不需要自己写出"辛亥革命的意义是...",只需要从 A B C D 里挑一个。
生成式模型呢?像写一篇命题作文。从第一个字开始写,写完想下一个,下一个又决定再下一个。你要自己创造内容,不能从现成选项里挑。

这两种模式的统计学基础也不同。
BERT 这条路,背后是频率学派的思路:统计训练数据中"问题-答案"的配对规律,遇到新问题就找最相似的训练样本。
GPT 这条路,背后更接近贝叶斯学派的思路:学习语言的"生成规则",给定开头就能顺着规则往下编。
频率派求稳,统计的是"什么最可能"。
贝叶斯派求真,模拟的是"为什么会这样"。
哪个更接近真正的"智能"?这个问题在学术界吵了几十年。但 GPT 的成功,至少证明了模拟生成过程这条路走得通。
三、Google 和 OpenAI 的技术赌局
2018 年是个分水岭。
Google 发布了 BERT,同时开源了代码和预训练模型。那几年,BERT 在 NLP 领域几乎是碾压级别的存在。文本分类、问答系统、情感分析、命名实体识别——几乎所有理解类任务,BERT 都能通过微调达到 SOTA。
Google 选这条路是有道理的。作为搜索巨头,Google 最需要的就是"理解"——理解用户的查询意图,理解网页的内容含义。判别式模型完美契合这个需求。
OpenAI 呢?它没有 Google 那样的搜索数据积累,也没有那么明确的应用场景。但它选择了一条更"笨"的路:让模型学习预测下一个词,用海量无标注数据训练。
这条路有多难?BERT 用的是"完形填空"式的自监督——把句子里的词挖掉,让模型预测填什么。GPT 用的是"接龙"式的自监督——给前半句,让模型预测后半句。
"完形填空"比"接龙"容易多了。因为完形填空有上下文约束,答案就在附近。接龙呢?后面可以接的东西太多了,概率分布太分散。

2018 到 2022 年,BERT 路线统治了 NLP 行业。每个任务都有对应的 BERT 微调模型,学术界发论文几乎离不开它。
OpenAI 呢?GPT-1 和 GPT-2 发布时,几乎没人看好。"生成式模型在理解任务上表现一般"、"生成文本不可控"、"实用性存疑"——这是当时的主流声音。
转折点发生在 2020 年的 GPT-3。1750 亿参数,few-shot learning,让人们看到了生成式模型的潜力。2022 年 ChatGPT 发布,直接引爆了生成式 AI 热潮。
回头看,Google 和 OpenAI 的选择,像极了两个登山队。
Google 选了索道,能快速到达半山腰(判别式任务表现好),但索道的终点就是半山腰。
OpenAI 选了野路,很难爬,爬得慢,但这条路的终点是山顶。
最后,反而是野路队先到了山顶。
四、Prompting 革命:一条钥匙开多把锁
2021 年,Prompting 技术开始流行,这件事彻底改变了游戏规则。
Prompting 的核心思想是:不再让模型去适应任务,而是让任务去适应模型。
BERT 的范式是微调(Fine-tuning)。针对每个任务,用标注数据重新训练模型的最后几层。做一个新任务,就要收集数据、训练新模型。
GPT 的范式是提示(Prompting)。不需要训练,直接用自然语言描述任务。比如你想让 GPT 做翻译,只需要说"请把以下英文翻译成中文:",然后给一段英文,它就给你翻译。

微调模式下,BERT 是专科医生。眼科医生只看眼睛,心内科只看心脏。想让 BERT 做翻译,就要用翻译数据微调;想做问答,就要用问答数据微调。每个技能都要专门培养。
Prompting 模式下,GPT 是通才。接受了通识教育后,给本教材就能自学新技能。只要你能用语言描述清楚任务,GPT 就能尝试做。
更重要的是,Prompting 让 GPT 可以用海量无标注数据训练。互联网上所有的文字都可以用来训练,不需要人工标注。这意味着训练数据量可以扩大几个数量级。
BERT 的训练数据呢?需要"完形填空"式的标注,数据的获取成本高得多。
这就是 GPT 路线越往后越猛的原因——数据优势滚雪球般扩大。而 BERT 的优势,在 GPT-3 之后就逐渐被蚕食了。
五、谁更强?看情况
BERT 擅长的领域:
- 文本分类:给定文本判断情感、主题、意图
- 问答系统:从文档中抽取答案
- 语义关系抽取:识别实体之间的关系
- 信息检索:判断文档和查询的相关性
这些任务的共同特点是:有明确的输入和固定的选项,答案相对确定。
GPT 擅长的领域:
- 文本生成:写文章、写代码、写邮件
- 对话系统:聊天、咨询、辅导
- 创意写作:写故事、写诗歌、写营销文案
- 多步推理:分解复杂问题逐步解决
这些任务的共同特点是:需要创造性的内容输出,没有标准答案。

BERT 像考试高手。做过的题目准确率极高,但遇到没见过的题型就犯怵。它的强项是"学得像"。
GPT 像见多识广的顾问。什么话题都能聊,虽然偶尔会"一本正经地胡说八道",但胜在通用性强。它的强项是"答得新"。
BERT 在学术研究和特定垂直领域仍然很好用。GLUE、SuperGLUE 这些基准测试,BERT 系列模型长期霸榜。
但产品化呢?用户要的不是"某个任务做得好",而是"什么问题都能帮上忙"。从这个角度,GPT 的通用性是碾压级的。
六、少林武当,各有绝学
故事还没完。
2022 年之后,OpenAI 的 GPT-4 继续领跑,但 Google 也没闲着。BERT 的后代们——RoBERTa、ALBERT、ELECTRA——在各个细分任务上持续优化。
有意思的是,中国的智谱 AI 推出的 GLM 模型,在 2023 年也转向了 Decoder-only 架构。这说明生成式路线被进一步验证。
判别式还是生成式?现在答案似乎清晰了——生成式是大道。
但 BERT 的遗产没有消失。它在编码器架构上的积累,催生了 sentence embeddings、语义检索、对比学习这些技术。这些在 RAG(检索增强生成)系统里,正在发挥重要作用。
武功门派之争,最后发现少林武当各有绝学。
BERT 擅长理解,在检索和分类场景依然是首选。
GPT 擅长生成,打开了通用人工智能的大门。
理解它们的差异,不是为了争个高下。而是为了在具体场景里,知道该选哪把钥匙。
BERT 和 GPT 的故事,某种程度上就是技术演进的缩影。没有绝对正确的路线,只有适不适合当前阶段的方案。Google 押注判别式没有错,那是当时的最优解。OpenAI 坚持生成式也没有错,那是通往更远的路。
技术路线的选择,从来都是一场豪赌。赌对了,引领时代;赌错了,被人遗忘。
下次面对一个 NLP 问题,你可以先问自己:我是需要一个"理解者",还是一个"创作者"?
问完这个问题,答案可能就清晰了。
不过话说回来,不管是 BERT 还是 GPT,它们都要面对同一个根本问题:Transformer 的计算复杂度。模型越来越大,参数越来越多,推理一次要消耗多少算力?这个成本问题,正在制约着整个行业的发展。
这就是下一篇文章要聊的了。
