大模型基础

大模型基础合集:一份给普通人的技术地图
你有没有这种感觉——
刷短视频的时候,算法好像比你自己还懂你。想买什么、想看什么,它总能精准推送。
问 ChatGPT 一个问题,它居然能接住你的思路,给出一个像模像样的回答。
然后你心里冒出一个问号:这个东西到底是怎么做到的?
那些动辄几百亿参数的模型,为什么突然就能"理解"人话了?
如果你有这些疑问,恭喜你——你找对了地方。
接下来的十篇文章,我会用最通俗的方式,带你从零搞懂大模型到底是什么、怎么工作、怎么用它做点有意思的事。
不需要你懂代码,也不需要你有机器学习背景。只要你有好奇心,够了。
第一件事:大模型的"大",到底大在哪里?
先破除一个误解。
很多人听到"大模型"三个字,下意识觉得是说某个软件很大、占内存很高。
不对。
大模型里的"大",指的是参数规模——模型内部那些需要学习和调整的数值。
参数是什么?你可以把它简单理解成大脑里的神经连接。
人脑有大约 100 万亿个神经连接,所以我们能思考、能推理、能举一反三。模型也一样——参数越多,它能捕捉的规律就越复杂、越细腻。
但这里有个特别有意思的现象。
当参数超过某个临界点的时候,模型的能力会突然跃升。
这叫什么?学术界叫"涌现"。
举个例子你就明白了。
我之前用过一个 70 亿参数的开源模型,跑在我自己的 Mac 上,回答一些简单问题还挺好使的。但让它写一篇完整的文章,中途就会开始"发癫"——逻辑断裂、前后矛盾。
换成 130 亿参数的版本,同样的问题,输出质量明显高了一个档次。不是好一点点,是那种"看得下去"和"看不下去"的区别。
再往上,1000 亿参数——不是简单的线性增长——模型突然就能写文章了、能做推理了、甚至能写代码了。
就像堆乐高积木。少一块的时候,那就是一堆散件,怎么看都不像东西。但积累到一定程度,突然就能拼出一座城堡。
这个临界点,就是"涌现"发生的地方。
所以大模型的核心秘密就是:规模产生质变。不是简单地"越多越好",而是量变引起质变。

文字进去,数字出来:大模型怎么"读"文本?
好,现在你知道了大模型参数很多、很大。
但这些参数到底在干什么活?
首先,有个反常识的事实:大模型不懂文字,它只懂数字。
所以当模型拿到一段文本时,第一步是把它转成数字。
这个过程叫 Tokenization——分词。
就是把文字切成一小块一小块的 token。
中文的话,一个 token 大约是 1-2 个汉字。英文更复杂一点,一个单词可能被切成好几个 token。比如 "unhappiness" 可能会被切成 "un"、"happi"、"ness" 三个 token。
为什么要切?因为这样处理起来更灵活,模型能更好地理解词的构成和语义。
切完之后,每个 token 都会被转化成一个数字向量。
这个向量里装着什么?装着这个词的"语义信息"——它在什么语境下出现、经常跟哪些词搭配、意思跟哪些词相近。
你可以把它想象成给每个词发了一张身份证,上面写着它的各种特征。
但问题来了——
单个词的向量只是孤立的点,模型怎么理解整个句子的意思?
这就引出了大模型最核心的技术:注意力机制(Attention)。
简单说就是:处理每个词的时候,模型会"看"这个词周围的所有词,然后决定应该重点关注哪些。
举个例子。"苹果"这两个字,在"苹果手机很贵"里指的是公司,在"这个苹果真甜"里指的是水果。
注意力机制让模型能根据上下文,准确判断每个词的具体含义。
它不是在孤立地理解每个词,而是在理解整个语境。
这就是大模型能生成连贯对话的原因——它不是在背答案,而是在"理解"你的问题之后,现场组织语言。

模型是怎么炼成的?两个关键阶段
知道了原理,那你有没有想过:这么复杂的模型是怎么训练出来的?
整个过程分为两个阶段:预训练和微调。
预训练:读遍天下书
预训练阶段,模型会"阅读"海量的互联网文本——网页、书籍、新闻、代码,什么都看。
这个阶段的目标是让模型学会语言本身的规律:语法是什么、词和词怎么搭配、什么样的句子是通顺的、什么样的表达是自然的。
打个比方。
就像一个人读了图书馆里所有的书。虽然他没专门学过某个领域,但读多了之后,他自然就知道怎么说话、怎么表达、什么话听着像人话。
预训练就是在做这件事——让模型通过海量阅读,学会语言的"语感"。
这个阶段完成后,模型就变成了一个"通才"——什么都能聊一点,但什么都不精通。
微调:术业有专攻
预训练完的模型已经很强了。但它还是通用的,就像一个什么都懂一点但没有专长的人。
要让它擅长某个具体任务,就需要微调。
微调是用特定领域的数据,对模型进行针对性训练。
我去年用 LoRA 微调过一个中文对话模型,前后花了大概一周时间。我手上有 2000 条高质量的问答对,格式是"用户问-助手答"。跑在一张 RTX 3090 上,大概训了 8 个小时。
出来的效果还挺让我意外的——它学会了我给的那种轻松、有点幽默、偶尔抖机灵的风格。不再是那种一本正经的"您好,请问有什么可以帮助您的"。
常见的微调方法有几种:
SFT(监督微调)——就像请了个老师,手把手教模型什么是正确答案。你给什么数据,它就学什么风格。效果最好,但成本高、耗时间。没有个几万条高质量数据,基本训不出什么名堂。
LoRA 和 QLoRA ——这是更聪明的做法。它们不去改模型的所有参数,而是在旁边训练一小部分"补丁"。这样即使你的显卡不够强,也能玩微调。QLoRA 更省资源,甚至可以在消费级显卡上跑。
我自己的经验是:如果你只有几千条数据,LoRA 是性价比最高的选择。如果你有十万以上的私有数据,而且对效果要求极高,那可以考虑 SFT。
打个比方:
预训练是完成九年义务教育,学的是基础知识。
微调是去读研究生,专门攻一个方向。
义务教育让你具备基本素质,研究生才能让你成为某个领域的专家。

对话的"调味料":温度和采样参数
模型训练好了,怎么用它?
核心工具就是 Prompt——提示词。
很多人觉得 AI 工具不好用,结果大概率是 Prompt 没写对。
问得好,AI 才能答得好。
我踩过很多坑。最早用 ChatGPT 的时候,我问"帮我写一篇文章",它给我的东西就是那种——怎么说呢——正确但无聊。假大空,全是套话。
后来我学会了说"帮我写一篇 1500 字的文章,受众是有一定工作经验的产品经理,语气要轻松,像两个人聊天一样,可以偶尔用点网络用语,但专业概念要解释清楚"。出来的质量完全不一样。
Prompt 不只是问个问题那么简单。好的 Prompt 通常包含:
- 指令:明确告诉 AI 你想要什么,别让它猜
- 上下文:提供相关的背景信息,让它知道你处于什么场景
- 输入内容:你要处理的具体内容
- 输出格式:你想要什么形式的回答,是表格、列表还是段落
除了 Prompt,还有一些控制输出的参数也很重要。
Temperature 控制随机性。设高一点,AI 就更有"创意",答案更发散。设低一点,AI 就更"保守",答案更稳定、更确定。
我一般写代码的时候设 0.2 到 0.3,让它别自己发挥。头脑风暴的时候设 0.8 到 1.0,让它多给我一些意想不到的点子。
你可以把它想象成调酒的烈度。想要一杯温和的慢慢品,还是想要一杯烈酒一口闷?
Top-p 和 Top-k 控制模型选择词的方式。这两个参数影响生成内容的多样性。
简单说,Top-k 是从概率最高的 k 个词里选。Top-p 是从概率加起来达到 p 的词里选。
调低这些参数,模型会更"保守",倾向于选择最安全的词。调高的话,模型会更"大胆",可能说出更出人意料的话。
说白了,Prompt 工程就是提问的艺术。你越清楚自己要什么,AI 就能帮你做得越好。

大模型的"阿喀琉斯之踵":幻觉问题
大模型很强大,但它不是万能的。有些坑,你必须知道。
什么是幻觉?
大模型有时候会一本正经地胡说八道。
它生成的内容语法正确、逻辑通顺,看起来像那么回事,但事实可能是瞎编的。
比如你问它"秦始皇在位期间发生了什么重大科技事件",它可能编一个听起来特别专业的事件出来,有时间、有地点、有人物,头头是道。
为什么会这样?
因为大模型本质上是预测下一个词该说什么,而不是真的在检索知识。
它只是在"模仿"它见过的文本风格。它不知道什么是对的、什么是错的,它只是在概率上选择最"像真话"的词。
所以,用它帮忙写文章可以——结构、语言、风格,这些它很擅长。
但涉及到具体事实,最好交叉验证一下。
有一次我想用 AI 查一个技术概念的出处,它给我列了三个"权威论文",标题看着特别正经。结果我去搜,第一篇不存在,第二篇压根没提那个观点,第三篇倒是真的,但论文里根本没说过 AI 说的那个结论。
从那以后,涉及事实核查的部分,我都会自己去确认一遍。
上下文窗口的局限
大模型还有另一个限制:上下文窗口。
就是你一次能发给它的文本长度是有限的。超出部分,它就"记不住"了。
比如早期 GPT-4 的上下文窗口是 8K tokens,大约等于一篇文章的长度。如果你的文档有几十页,发给它就会出问题。
现在很多模型已经支持 128K 甚至更长的上下文。但"能放进去"和"能理解"是两回事。
长文本的理解能力,还在持续提升中。
所以大模型更像是一个记忆力有限但想象力丰富的专家——用它擅长的事情,用它听得懂的方式问它。
从聊天到智能助手:大模型的应用进化
单个模型能做的事有限。
但给它配上合适的工具和环境,就能玩出很多花样。
Function Calling:让 AI 调用工具
大模型本身只能输出文字。
但通过 Function Calling,它可以调用外部的 API 和工具。
比如你说"帮我查一下今天北京的天气",模型识别到这是个天气查询请求,就会去调用天气 API,然后把结果整合成自然语言告诉你。
这就像给 AI 安装了手和脚,它不再只能"说",还能"做"。
我写过一个简单的助手,就是用 Function Calling 做的。跟它说"提醒我下午三点开会",它会调用日历 API;说"播放一首轻松的歌",它会连上音乐软件。
RAG:给 AI 装上百科全书
模型的知识是训练时固定的,它不知道最新的新闻、不了解你们公司的内部资料。
RAG(检索增强生成)就是来解决这个问题的。
当用户提问时,RAG 先去外部知识库检索相关内容,然后把检索结果和问题一起发给模型。
这样模型就能回答"最新发布的 iPhone 有哪些功能"这种实时问题,或者"我们公司的报销流程是什么"这种内部知识问题。
我见过一个特别实用的例子——用 RAG 搭了一个客服机器人,把公司所有的产品文档、常见问题、操作手册都扔进去。用户问问题,它先检索相关段落,再让模型根据这些内容回答。
上线之后人工客服的压力少了一大半。
Agent:让 AI 自己规划任务
更高级的是 Agent 架构。
给 AI 一个目标,它会自己拆解成多个步骤,调用不同的工具,层层推进直到完成任务。
就像有个超级能干的实习生。
你只说"帮我整理一下这个月的运营数据,做个分析报告"。
它会自己去拿数据、做分析、生成图表、写报告——不需要你一步步指挥,它自己知道该怎么做。
基础模型是聪明的大脑,工具和工作流是给它配备的办公室设备。
设备越齐全,它能做的事就越多。

写在最后:这份合集能给你什么?
好了,这就是大模型基础合集的完整地图。
我们从最基本的问题——什么是大模型、大模型的参数和涌现现象——出发,一路讲到 Token、注意力机制、预训练、微调、Prompt 工程、幻觉问题,最后到 RAG 和 Agent。
这十篇文章覆盖了大模型从原理到应用的完整知识体系。
你可以按顺序一篇篇读下来,打牢基础。也可以挑感兴趣的话题深入研究。
每一个板块都是独立的,但组合在一起,就是大模型世界的全貌。
死记硬背没有意义。理解核心原理之后,你会发现大模型并不神秘——它只是一个被海量数据训练出来的、很会预测下一个词的超级系统。
掌握了这些基础,你就能更好地驾驭它,而不是被它驾驭。
下篇文章,我们会正式开始第一课。
我们会深入聊聊大模型到底是什么,以及那个让很多人困惑的问题:为什么参数规模变大后,模型的能力会发生质变?
涌现现象背后的原理是什么?为什么不是线性增长,而是突然"开窍"?
准备好了吗?
