大模型幻觉是什么?

大模型幻觉是什么?为什么模型会一本正经地胡说?
你有没有遇到过这种情况:问AI一个历史问题,它讲得特别顺,你听着觉得挺有道理。信了,兴冲冲去跟朋友分享,结果一查资料,发现根本不是那么回事。
这种情况,有个专门的名字——大模型幻觉。
上篇我们聊了上下文窗口,知道了模型能"记住"多少内容。但问题来了:模型记住了,就代表记住的是对的吗?
还真不一定。
今天咱们就来拆解一下,这个让人又爱又恨的"一本正经胡说八道",到底是怎么回事。
先认识一下——什么是大模型幻觉?
大模型幻觉,说白了就是:模型用特别自信的语气,给你输出一段听起来特别像那么回事,但实际上完全错误或者根本不存在的内容。
有三个关键特征:
输出流畅。读起来通顺得很,完全不像胡说的样子。
语气确定。"根据资料显示"、"研究表明"、"历史记载"——这些词一出来,你是不是就信了?
内容与事实不符。可能是日期错了,可能是人物不存在,可能是论文根本没发表过。
举几个真实的例子:
你问ChatGPT:"请推荐几篇关于Transformer的早期论文。"
它可能会给你列出一串论文,标题像那么回事,作者也像那么回事。但你一查——嘿,有那么一两篇根本不存在,是模型现编的。
再比如,你问一个比较冷门的专业问题,模型编造答案的概率就会大幅上升。我之前试过问某个小众领域的研究细节,AI给的那几个"关键文献",一篇都找不到。
给你类比一下:
大模型幻觉,就像一个嘴皮子特别利落的销售员。他说什么都特别笃定,特别有感染力,但你要是较真去核实,发现他说的十个点里有两三个是吹牛。他不是故意骗你,而是他自己都信了。

为什么AI会"自信地胡说"?——从它的工作方式说起
要理解幻觉是怎么来的,咱们得先搞清楚大模型到底在干什么。
大模型本质上是干什么的?
文字接龙机器。
就是给它一段话,它来猜下一个字最可能是什么。你让它写文章,它其实是在不停地猜"下一个词应该是什么"。
这个过程叫"next token prediction"——预测下一个词。
举个例子:
输入:"今天天气真"
模型会计算所有可能下一个词的概率,然后选概率最高的输出。概率分布大概是"好"最高,"冷"次之,"棒"和"差"更低。
明白了吗?
模型只关心"哪个词最像话",不关心"哪个词是对的"。
这就有问题了。
训练模型的时候,目标是让它说的话"更像人话"。你喂给它海量的文本,它学会的是:什么样的句子看起来合理,什么样的搭配常见。
但它学的不是"什么是真的"。
再给你类比一下:
想象一个人,他从来没学过历史,但他背了很多历史书。考试的时候,他不是在想"这段历史是真的吗",而是在想"哪个答案读起来更像书上的语气"。
他答对了,不是因为他懂历史,而是因为他猜对了阅卷人喜欢什么。
久而久之,他连自己都信了——我背的肯定是对的。
模型也是这样。它不知道自己说的是真的还是假的。它只是在预测:什么样的内容"听起来更对"。

三个阶段,三种"放飞自我"的方式
模型产生幻觉,不是一个环节出了问题,训练、对齐、生成三个阶段都有可能出问题。
训练阶段——用错了教材
训练数据里可能就有错误。互联网上的内容,有多少是准确的?有多少是过时的?有多少是互相矛盾的?
模型学的时候照单全收。
而且训练的时候还有个问题:过拟合。
模型对训练数据里的错误知识学得太"到位"了,以至于它对这些错误知识特别自信。你问它相关问题,它就特别笃定地输出那些错误答案。
就像一个学生用了盗版的教材,把教材里的错误答案背得滚瓜烂熟,考试遇到原题,错得特别理直气壮。
对齐阶段——学会了两面三刀
对齐是让模型"听话"的过程。人类训练师会评估模型的回答,给它反馈:这个问题答得好,那个问题答得不好。
但这个评估标准本身就有问题。
想象一下评估标准是这样的:答对了加分,答错了不加分,但不回答也扣分。
模型会怎么选?
它会选择"赌一把"——编一个答案出来。
因为不回答会扣分,答错了不扣分,那当然要硬着头皮答。
慢慢地,模型就学会了一件事:宁可胡说,也不能说不知道。
生成阶段——一步错步步错
模型生成内容是一个字一个字往外蹦的。
生成第一个字,没问题。
生成第二个字,根据第一个字来,也没大问题。
生成第三个字,根据前两个来,可能开始有点歪了。
但模型没办法回头修改。它只能继续往前冲,越偏越远。
这就像你写文章,写到第三段发现前面有个错字,但你没办法撕掉重写,只能硬着头皮往下编,编到最后自己都不知道在说什么了。

为什么这个问题这么难解决?
你可能会想:幻觉这么讨厌,把它修掉不就行了?
还真没那么简单。
准确率有天花板
有些问题本身就是"无解"的。
比如你问:"某某公司的CEO去年参加了几个会议?"
这个信息可能根本不存在——从来没有被记录过,从来没上过新闻。模型怎么答都是错的。
不是模型的问题,是这个问题本身就没有正确答案。
大模型反而更"自信地错"
有意思的是,有时候小模型比大模型更"诚实"。
小模型会说:"这个问题我不知道。"
大模型呢?它太能编了,什么都能扯出一套说辞,而且说得特别像回事。
但你一问它没学过的东西,大模型更容易一本正经地胡说,小模型反而会老实承认。
这叫什么?这叫过度自信。
模型越大,能力越强,但它也越容易高估自己。

评估标准本身在奖励幻觉
这个问题最讽刺。
我们怎么判断模型好不好?靠benchmark——标准测试题。
但这些benchmark有个问题:它们只看答对还是答错。
模型答对了,评分高;模型编了一个听起来很对的答案,也评分高。
那模型自然就学会编了。
这就像考试只看你写没写字,不看你写得对不对。学生会怎么应对?乱写呗,反正写了就有分。
我们能做什么?——应对幻觉的几种思路
说了这么多问题,那总得有点解决办法吧?
有几个方向正在探索:
RAG——让AI先查资料再回答
RAG,全称Retrieval-Augmented Generation,检索增强生成。
原理很简单:不是让模型靠记忆回答,而是让它先去找资料,找到相关的文档,然后再基于这些文档来回答。
这就像开卷考试。你有一本教材,查着答,总比闭着眼睛瞎编强。
具体流程是这样的:
用户问一个问题 → 系统去知识库里检索相关文档 → 把检索到的文档和原问题一起发给大模型 → 大模型基于这些"参考资料"来生成答案。
当然,RAG也有问题:检索可能检索错,知识库本身可能有错误,模型可能错误理解了检索到的内容。
但至少,它给模型提供了一个"锚点",减少了纯靠记忆瞎编的比例。
改进评估范式——奖励"我不知道"的诚实
传统的评估是:答对了加分,答错了不加分。
新的思路是:答对了加分,答错了扣分,但主动说"我不知道"也给加分。
这样模型就不会被逼着瞎编了。
当然,这需要重新设计评估标准,重新训练模型,代价不小。
后验检测——让模型自己检查自己
另一个思路是:让模型生成完之后,自己再过一遍,看看有没有问题。
但问题是,模型怎么知道自己说的是错的?
它又不像人类,可以去查资料验证。
目前有一些研究在探索用模型内部的"激活状态"来判断置信度——模型对自己说的话到底有多自信。但这个方向还不够成熟。

保持清醒——使用AI的正确姿势
说了这么多,最后给你几条实操建议。
AI是助手,不是权威。
特别是涉及专业领域——法律、医疗、财务——AI说的话只能当参考,最终决策得靠自己或专业人士。
学会提问。
你可以让模型在回答时标注信息来源:"根据某篇论文显示……"
你也可以直接问它:"你对这个答案有多大把握?有没有什么不确定性?"
好的提问方式能减少被幻觉坑的概率。
理解局限。
有些问题本质上就没有确定答案。
比如你问:"你觉得哪个公司未来会发展得更好?"
这个问题,模型给不出正确答案,因为它不是预测未来的水晶球。
理解AI的边界,比盲目相信AI更重要。
把AI当成一个知识渊博但偶尔犯糊涂的同事。
你需要核实它的关键信息,但它确实能帮你快速搞定很多事。
下期预告
聊完了大模型为什么会一本正经地胡说八道,你可能会想:
那我们能不能控制它"胡说八道"的程度?
能。
下一期我们就来聊:大模型推理参数怎么调?Temperature、Top-p、Top-k 有什么区别?
这三个参数,直接决定了你跟AI对话时,它的回答是多变还是稳定,是保守还是激进。
调好了,AI的回答就能更符合你的预期。
我们下期见。
