多模态模型有哪些局限?

多模态模型有哪些局限?幻觉、定位错误和细节丢失怎么理解?
你有没有过这种经历?
让AI看一张图,它说得头头是道。你仔细一看,图里根本没那东西。
这不是AI在跟你开玩笑。这是它的"幻觉"。
上一篇文章我们聊了OCR、图表理解和文档理解这些能力。你已经知道多模态模型能"读懂"图片了。
但今天要泼点冷水——它并没有那么可靠。
多模态模型很强,但它也会"看错"
先说个真实案例。
有人让GPT-4V描述一张咖啡馆的照片。模型说照片里有个男人在喝咖啡。实际上呢?那根本不是咖啡馆,是图书馆,而且照片里根本没有男性。
这种睁眼说瞎话的情况,在多模态领域有个专门的名字——幻觉。
问题来了:为什么一个能理解图片的AI,还会出现这种低级错误?

要回答这个问题,我们得先搞清楚幻觉到底有几种。
幻觉的三张面孔——对象、属性和关系
幻觉不是只有一种。它至少有三张不同的面孔。
第一张:对象幻觉。
图里明明没有这个东西,模型却说看到了。
比如一张图里只有一只猫,模型非说"图中有一个人在抚摸猫"。人从哪来的?它自己脑补的。
第二张:属性幻觉。
物体确实存在,但特征说错了。
黑猫说成白猫。圆桌说成正方形。苹果说成香蕉。
你一看图,明明是只黑猫。模型怎么色盲了?
第三张:关系幻觉。
物体和属性都对,但它们之间的关系搞错了。
"猫在沙发上"说成"猫在沙发下面"。物体对,属性对,就是位置关系反了。
这三种幻觉就像描述一部电影时说错演员、说错造型、说错剧情。单个看都能接受,叠在一起就完全变味了。

那问题来了——这些幻觉到底是怎么产生的?
幻觉从哪来?
幻觉不是单一原因造成的。我梳理了一下,大概有这几个环节会出问题。
训练数据的问题。
如果教材本身有错误,学生怎么可能考满分?
多模态模型的训练数据里,图文对应关系经常不准确。有时候图片描述是人工标注的,人会疲劳、会走神、会有偏见。这就好比老师自己先把题目看错了。
另外,很多罕见物体在训练数据里出现得太少。模型见都没见过几次,你让它准确描述,这不是为难人吗?
我在实际测试中发现,模型对Logo、装饰图案这类"背景物件"识别错误率特别高,因为训练数据里这类图片的标注质量最差。
视觉和语言的对接问题。
图片要被转成模型能理解的向量,语言也要被转成向量。这两个向量要对齐才能进行比较。但目前的对齐方式太粗糙了。
想象你把一幅清明上河图压缩成一张马赛克。信息丢失了多少?
很多细粒度的视觉信息在这个过程中被牺牲掉了。模型看到了"大概",但丢失了"细节"。
模型太相信自己。
大语言模型有个毛病——它太相信自己了。
模型在预训练阶段学到了大量知识。当它看到一张图片时,有时候不是真的在看图,而是根据自己记忆中的知识在"编"描述。
这就像一个人戴着有色眼镜看世界。他看到的不是真实景物,而是他以为应该看到的东西。
生成时的选择问题。
生成回答的时候,模型会选择"最可能"的词。
但问题在于,语言模型觉得"最可能"的词,往往是"最常见"或"最流利"的,而不是"最准确"的。
一句话说出来很通顺,但和图片可能完全不搭。
这四个环节环环相扣。任何一环出问题,幻觉就可能冒出来。

定位错误和细节丢失——看得见但看不准
除了幻觉,还有两类问题同样值得关注。
定位错误。
你问模型:"图里那只狗在哪?"
模型说:"在图片的左边。"
实际上狗在右边。
这不是幻觉,因为模型确实看到了狗。但它搞不清楚狗和位置的对应关系。
这就好比你远远看到教室黑板上写着字。你能说"黑板上有字",但说不出具体在哪个位置。黑板很大,字很小,定位失败了。
细节丢失。
你让模型描述一个人的穿着。它说"穿着一件格子衬衫"。
你再看图——衬衫上印着一行小字:"I love AI"。
模型完全没提这行字。因为它看到的是"衬衫",不是"衬衫上的字"。
这种细节丢失在多模态理解中非常普遍。模型擅长捕捉"大概",但不擅长捕捉"具体"。
这两个问题和幻觉不太一样。幻觉是"看到了不存在的东西",定位错误和细节丢失是"看到了但说不对"。

如何评估和缓解这些局限?
办法是有的。虽然不能完全消除,但能显著降低出错率。
评估方面。
你得先知道问题有多大,才能判断改进有没有效果。研究人员开发了专门的评估指标。比如CHAIR指标专门检测对象幻觉——我看过的一份报告显示,早期模型CHAIR值只有60%左右,意味着将近四成描述的对象是图片里没有的。这个数字挺吓人的。后来GPT-4V等新模型出来后,降到了20%左右,好了一些,但还是不低。
POPE则用一种更聪明的提问方式,让模型只能回答"是"或"不是",这样更容易发现它有没有在瞎说。
缓解方面。我总结了四个可以发力的方向:
数据层面。
与其只给模型看"正确的图+正确的描述",不如也给它看"错误的图+错误的描述"。
让模型学会对比。知道什么是对的,什么是错的。这样它才能形成更准确的判断。
模型层面。
最直接的办法是提高输入分辨率。
之前很多模型只能看到224×224像素的图片,这么小的图能看清什么?现在有模型用到448×448甚至更高。看得更清楚,自然错得更少。
还有些模型选择用多个视觉编码器。CLIP看整体,DINO看局部。各取所长,互补短板。
训练层面。
新设计的训练方法也在起作用。
比如HACL方法,通过对比学习让模型更关注图片和文字之间的对应关系。还比如基于人类反馈的强化学习,让真人告诉模型哪个描述更好,模型据此调整自己的行为。
推理层面。
最后一个办法是在输出环节做检查。
让模型生成多个描述,然后对比哪个和图片更匹配。这就像写完作文再检查一遍,看看有没有说漏嘴或说错的地方。
这些方法叠加使用,效果会更明显。但说实话,目前还没有一劳永逸的解决方案。

未来展望
说了这么多问题,是不是觉得多模态模型挺不靠谱的?
但换个角度看,这些"bug"也许恰恰是进化的必经之路。
汽车刚发明那会儿,经常抛锚,故障率比马车高多了。但没人说汽车没前途。通过不断改进,它最终成了最安全的交通工具。
多模态模型也是如此。幻觉问题现在很严重,但研究进展也很快。每一次技术突破都在让这些错误变得更少。
有意思的是,有学者提出幻觉未必全是坏事。
在创意生成场景里,模型"脑补"的能力反而是优势。你让它写一个不存在的东西,它编得越丰富、越生动越好。这时候幻觉就变成了创造力。
当然,在医疗诊断、自动驾驶、法律文书这些领域,幻觉就是灾难。任何一点错误都可能造成严重后果。
所以关键问题是:在哪些场景下我们可以容忍幻觉,在哪些场景下必须消灭它?
这个问题没有标准答案。但作为AI从业者,我们必须清楚自己模型的能力边界。

知道它能做什么,比吹嘘它能做什么更重要。
七篇文章写到这里,关于多模态的基础知识就告一段落了。
从视觉编码器到图文对齐,从多模态大模型到具体的理解任务,再到今天的局限与挑战——我们一起走过了多模态AI的完整知识地图。
这只是开始。真正的探索,在实际应用中去检验。
