大模型幻觉是什么?

大模型为什么会"一本正经地胡说八道"?
你调低了Temperature,输出了Top-p参数,满心以为这次AI的回答会更准确。结果它给你编了一个完全不存在的历史事件,还说得跟真的一样。
这就不只是随机性的问题了。
上次我们聊了生成控制参数怎么影响输出多样性。但你有没有想过:为什么模型明明"听话"了,还是会睁眼说瞎话?
这就是今天要聊的大模型幻觉。
幻觉不是bug,是模型的"正常"输出
先明确一件事:大模型产生幻觉,不是偶发的故障,而是它的正常工作方式。
你问它:"《百年孤独》的作者得过几次诺贝尔文学奖?"
它回答:"加西亚·马尔克斯在1982年获得诺贝尔文学奖,这是他唯一一次获奖。"
这个回答听起来完美无缺。事实上,1982年马尔克斯确实获得诺贝尔奖,这是真的。
但如果你接着问:"他领奖的时候穿的是什么颜色的西装?"
模型可能会说:"据史料记载,他穿着深蓝色三件套西装领奖。"
这个"史料记载"根本不存在。
语言流畅、逻辑自洽、语气自信——幻觉的三大特征全齐了。模型不是在"思考"答案,而是在"表演"一个知识渊博的人该有的说话方式。
它像一个特别会讲故事的人。你能听得入迷,但事后发现——全是编的。

模型不是在"回答",而是在"预测"
要理解幻觉为什么必然存在,得先搞懂大模型到底在干什么。
大模型的本质任务是:预测下一个词应该是什么。
不是"回忆"答案,不是"检索"知识,而是"概率计算"。
你输入"中国的首都是",模型不是在知识库里翻"北京"这个条目。它是在计算:在 billions of tokens 的训练数据中,"北京"出现在"中国的首都是"后面的概率最高。
所以它输出"北京"。
这个机制本身没问题。问题出在:当训练数据里"中国的首都是北京"出现了一万次,"中国的首都是南京"只出现了十次时,模型当然会选概率更高的那个。
但如果问题是"苏轼写过哪篇著名的悼亡词"?
模型开始"拼凑"了。它知道这是关于苏轼的问题,知道这是悼亡词,知道这个词牌名可能叫"江城子"或"蝶恋花"。它把最可能的词一个接一个串起来,形成一个听起来完整的回答。
至于内容是不是准确——训练的时候没人告诉它要核对事实。
概率驱动,而非事实驱动。这就是根本矛盾。

评估机制在"帮倒忙"
模型为什么会选择"编"而不是"说不知道"?
这里有个被忽视的原因:现行评估机制在奖励这种行为。
想想传统考试怎么打分:答对得分,答错不得分。
模型面对一个问题,知道自己不太确定。猜一下——有概率得分。不答——铁定零分。
理性选择当然是猜。
更糟糕的是,有些评估还会额外惩罚"拒绝回答"的行为。模型发现:不答比答错扣更多分。那还不如硬着头皮编下去。
结果就是:模型学会了"宁错勿缺"。
这像一场只扣分不加分的考试。学生发现乱写也能得分,当然选择能写就写。写满试卷,至少不会太难看。
评估只看"答对多少题",不看"放弃多少题"。
传统机制只惩罚错误,不惩罚瞎猜。
模型的行为被这个逻辑驯化了:与其诚实地说不知道,不如自信地编一个。

两个模型的数据对比,揭露了真相
说数据可能更直观。
2025年6月的测试中,研究者对比了两款主流模型在困难问题上的表现:
o4-mini:遇到不会的题目,52%的时候直接放弃,答对的22%,答错的只有26%。
GPT-5-thinking-mini:几乎不放弃,1%的放弃率,答对率也是24%,但答错的——高达75%。
表面看,两者的准确率差不多。24%对22%,差了两三个百分点。
但可靠性天差地别。
o4-mini像那种聪明的学生,考场上遇到没把握的题果断跳过,把时间留给会做的。错题率控制得很低。
GPT-5-thinking-mini像那种死要面子的学生,明明不会,非要写满。交卷的时候看起来答案满满全是红叉。
准确率相近,自欺欺人的程度完全不同。
这个数据告诉我们:衡量AI能力,不能只看答对率,还得看它有没有自知之明。

让AI学会说"我不知道"
问题清楚了,解决方案也就有了方向。
第一步:改变评估标准。
不仅看答对率,还要看"正确放弃率"——模型有没有本事在不确定的时候说不知道。
第二步:调整激励机制。
惩罚过度自信,奖励不确定性表达。答错了扣分,答"我不确定"——零分,不扣分。
第三步:用户认知也要跟上。
"我不知道"不是AI无能,而是AI负责。下次你看到AI诚实地说自己不确定,应该感到庆幸。
第四步:技术手段配合。
给模型接入检索工具,让它能实时查证事实。这不是从根本上解决幻觉,但能显著降低事实性错误。
标准化考试的演变可以参考。GRE考试采用"答错倒扣分"的机制,学生发现瞎猜成本太高,反而更谨慎。
大模型评估也在走这条路。

和AI有效合作的正确姿势
幻觉短期内不会消失。
作为用户,你需要接受这个现实,然后想办法应对。
首先,改变预期。AI不是万能的百科全书,而是一个知识渊博但有时会走神的同事。
关键任务不要盲信AI输出。医疗诊断、法律建议、财务判断——这些领域的数据一定要交叉验证。
其次,学会提问技巧。问"请列出你确定的信息来源"比问"请告诉我关于X的一切"更可能得到可靠回答。
最后,理解AI的局限性不是它的缺点,而是它的特点。
大模型在创造性任务上表现出色,在事实核查上天生短板。这是架构决定的,不是努力就能完全克服的。
用对场景,才能用好AI。
下一步的问题
评估改革、激励机制优化、技术工具辅助——这些方法都在推进。
但还有一个更深层的问题:为什么Transformer架构天生就擅长编故事?
这就要说到它的"近亲"——下一个要聊的MoE架构。
为什么很多新模型放弃了"全参与"的设计,改用"专家混合"的结构?这种改变能解决幻觉问题吗?
