Transformer 是什么?为什么它成为大模型的基础架构?

Transformer 是什么?为什么它成为大模型的基础架构?
上次我们聊了 Attention 机制——AI 是怎么学会"看重点"的。但你有没有想过,这种注意力机制到底是怎么落地的?光有关注能力还不够,模型还需要一套高效的"身体"来执行这些操作。这套"身体",就是 Transformer。
2017 年,Google 的几位研究员发表了一篇论文,标题叫《Attention Is All You Need》。翻译过来就是:"注意力就是你需要的一切"。听起来很狂,对吧?但事实证明,这帮人还真没吹牛。这篇论文提出的 Transformer 架构,彻底改变了 AI 的发展方向。
一场"意外"的革命
故事要从 2017 年说起。
当时 Google 的机器翻译团队只是想改进一下现有的翻译系统。他们尝试用注意力机制来增强 RNN 模型,结果一不小心,把整个 RNN 都给抛弃了。
这就好比你本来只是想换个沙发,结果把整个客厅都重新装修了。
Transformer 的设计初衷很简单:改进机器翻译。但它的影响远超这个范围。八位作者之一 Aidan Gomez 后来回忆说,团队里的 Vaswani 从一开始就坚信这个方向会改变游戏规则。但其他人呢?大多只是觉得这是个还不错的尝试。
这个"还不错的尝试",后来成了大语言模型的基础架构。

注意力机制是怎么工作的?
在说 Transformer 之前,我们先搞清楚它的核心——注意力机制是怎么运作的。
每个词进入模型后,会被转换成三个向量:Query(查询)、Key(键)、Value(值)。
这三个名字听起来很抽象,但其实很好理解。
想象你去图书馆找书。Query 就是你的问题:"我想找关于人工智能的书"。Key 就是每本书的标签或简介,它会告诉你这本书和你的问题有多相关。Value 则是书的实际内容。
你拿着问题去问每本书的 Key,然后根据匹配程度,决定从每本书里获取多少信息。
注意力机制的核心思想就这么简单:通过 Query 和 Key 的匹配程度,来决定应该关注哪些 Value。
但单个注意力头只能看到一个角度。多头注意力机制让模型可以从多个角度同时分析。
比如看一句话"他打开了那个红色的盒子":
- 一个头关注语法结构
- 一个头关注语义关联
- 一个头关注指代关系
多个头协同工作,就像一个团队从不同角度分析问题,最后综合得出结论。
还有一个有趣的细节:注意力是非对称的。
你很在意某个人,不代表那个人也在意你。这种不对称性在理解上下文时非常关键。比如"他很难过,因为考试没考好"——我们需要知道是"他"在难过,而不是"考试"在难过。

并行处理:Transformer 碾压 RNN 的关键
注意力机制很强大,但如果底层架构效率低下,再强的能力也发挥不出来。
这就要说到 Transformer 真正厉害的地方了——并行处理。
我们来对比一下 RNN 和 Transformer 的工作方式。
RNN 处理一句话,就像排队买票。你必须一个一个来,前一个人买完,下一个人才能上。如果前面那个人选了十分钟,后边的人就只能干等。
Transformer 呢?它可以同时处理整个序列。
就像自助取票机,所有人同时操作,互不干扰。10 个人买票,RNN 可能要 10 分钟,Transformer 可能只要 1 分钟。
这种并行能力带来了什么?
训练速度大幅提升。
之前受限于 RNN 的串行结构,模型没法太大。2017 年前,最大模型的参数大约是 9000 万。再大,训练时间就长得不可接受了。
但 Transformer 出现后,一切都变了。
Stanford 的研究人员把基于 Transformer 的模型称为"基础模型"(Foundation Model)。这个称呼的背后,是一个根本性的范式转移:以前是"训练一个模型解决一个问题",现在是"预训练一个大模型,然后用少量数据微调解决各种问题"。
简单来说,Transformer 让 AI 进入了"大模型时代"。

从 9000 万到万亿:参数规模的爆炸
数字最能说明问题。
2017 年,Transformer 刚诞生时,最大模型的参数约 9000 万。
2020 年,OpenAI 的 GPT-3 把这个数字推到了 1750 亿。1750 亿是什么概念?是 9000 万的将近两万倍。
两年后,Google 的 Switch Transformer 突破了万亿参数大关。
这种增长,不是线性增长,而是指数级增长。
如果 2017 年的模型参数相当于一个班级的学生人数,那现在的模型参数已经相当于全人类的数量了。
这种爆发式增长的前提,正是 Transformer 的并行训练能力。没有这个架构革新,训练万亿参数级别的模型?做梦去吧。
为什么参数越多越好?
你可以把参数理解为模型的"记忆容量"和"理解能力"。参数越多,模型能记住的知识越多,能理解的模式越复杂。
但这不意味着参数多就一定好。关键是看这些参数是怎么被训练和组织的。这也是为什么有些小模型反而比大模型表现更好——训练方法和数据质量同样重要。

三种架构变体:不是所有 Transformer 都一样
Transformer 不是铁板一块。
它有三种主要的架构变体,每种都有自己的特点和适用场景。
编码器-解码器架构是原版 Transformer 的设计,适合翻译这类任务——输入是一段序列,输出也是一段序列。类比一下,它像"同声传译专家",先理解原文,再翻译成目标语言。代表模型是原版 Transformer 和 T5。
仅编码器架构的代表是 BERT 和 RoBERTa。这种架构只保留编码器部分,擅长理解任务。比如判断一句话是正面还是负面,或者找出文本中的实体。这类模型像"阅读理解高手",能看完整个输入,然后回答问题或做分类。但它有个局限:只能"看完再说",没法边看边生成。
仅解码器架构的代表是 GPT 系列。这种架构只保留解码器部分,擅长生成任务。它只能看到之前的输出,然后预测下一个词。更像是一位"写作大师",不是在回答问题,而是在续写文本——一个词接一个词地生成。ChatGPT 用的就是这种架构。你输入一段话,GPT 逐字生成回复,每次生成一个字或一个词。

超越 NLP:Transformer 的跨界能力
Transformer 的影响力早就超出了自然语言处理领域。
最著名的例子是 AlphaFold2。这个用 Transformer 架构的 AI 系统,解决了困扰生物学界 50 年的难题——预测蛋白质的三维结构。
蛋白质是由氨基酸链折叠而成的三维结构。以前想知道结构,只能靠实验室里慢慢解析,耗时几年是常事。AlphaFold2 可以在几小时内预测出结构,准确率还很高。
新药研发、疾病研究、基础生物学……所有这些领域都被加速了。
在药物发现领域,MolBART 等模型用 Transformer 来预测分子的化学性质,帮助科学家更快地找到有潜力的候选药物。
在音频处理领域,Transformer 被用来做语音识别和音乐生成。
在多模态学习领域,Transformer 让 AI 能同时理解和生成文本、图像、音频。
甚至在机器人控制领域,Transformer 也开始崭露头角。
说到底,Transformer 本质上是一个通用的模式识别引擎。它擅长发现序列中各个元素之间的关系,而这种能力不限于文字。
图片是像素序列,音频是波形序列,蛋白质是氨基酸序列,分子是原子序列……只要你能把问题表示成序列,Transformer 就有用武之地。
写在最后:AI 革命的缩影
从 2017 年那篇论文,到现在 GPT-4、Claude、Gemini 等百花齐放,Transformer 用不到十年时间重塑了整个 AI 领域。
我们这个系列从机器学习的基本概念讲起,一路聊到了深度学习、神经网络、Attention 机制,直到今天的 Transformer。
这条线索,其实就是 AI 发展的主线:怎么让机器更好地理解和处理信息?
从最早的手动设计规则,到后来让机器自己学习特征;从 CNN 识别图像,到 RNN 处理序列,再到 Transformer 实现并行处理——每一次进步,都在突破之前的瓶颈。
但技术的演进永无止境。
当上下文窗口越来越大,当推理成本越来越高,当模型变得越来越大——下一个"Transformer 时刻"会来自何方?
是更高效的注意力变体?还是全新的架构范式?
也许,答案就藏在你们这一代人的手里。
系列回顾
12 篇文章,我们一起走过了 AI 的基础世界。从"什么是机器学习"到"Transformer 为什么成为大模型的基础",希望这些内容能让你对 AI 有一个系统的认知框架。
AI 不是魔法,也不是玄学。它是数学、概率论、计算机科学的集大成者,是无数研究者几十年努力的结晶。
理解它,你就能更好地使用它,甚至创造新的可能。
下次当你和 ChatGPT 对话时,不妨想一想:这句话是怎么被"理解"的?下一个词是怎么被"预测"的?Transformer 里的注意力头在关注什么?
问题永远比答案更有价值。
