多模态基础

合集文章导航
本合集共 7 篇文章,涵盖多模态大模型核心知识:
- 多模态模型是什么? - 文本、图像、音频如何统一理解
- CLIP 是什么? - 图文对齐的核心思想
- 视觉 Token 是什么? - 图片是怎么送进大模型的
- 多模态大模型怎么工作? - 从图像理解到视觉问答
- OCR、图表理解和文档理解有什么区别? - 三种理解能力对比
- 多模态 RAG 怎么做? - 图片、表格和 Markdown 图像如何入库
- 多模态模型有哪些局限? - 幻觉、定位错误和细节丢失
多模态基础合集:AI是如何学会"看懂"这个世界的?
你有没有想过这个问题——
为什么现在的AI能一边看图一边跟你聊天?发一张照片问它"这图里有几个人",它居然能答对。这事放在五年前,根本不敢想。
你可能会说:AI不是一直能看懂图片吗?
还真不是。
早期的AI,每个模型只擅长一件事:专门识别文字的、专门识别图片的、专门听懂语音的。它们像几个性格各异的同事,各干各的,谁也不搭理谁。
直到多模态技术出现,AI才真正开始像人一样,同时调动眼睛、耳朵和脑子。
这个合集,就是来拆解这项技术的。从最基础的概念,到背后的原理,再到实际怎么用、有哪些坑——我用大白话讲清楚,你听着轻松点。
读完之后,你再看那些"AI看图说话"的案例,会有一种"原来如此"的感觉。
准备好了吗?我们开始。
01 什么是多模态?为什么它让AI突然变强了?
先说个身边的例子。
你去相亲,对方发来一张照片。正常人看一眼就知道:这人长得怎么样、背景是餐厅还是户外、穿的正式还是休闲。
这个"看一眼就知道"的过程,其实调动了好几种信息:图像、文字描述、你自己的常识判断。
但传统AI呢?
它要么只能处理文字(像个只能听语音的盲人),要么只能处理图片(像个只能看图不会说话的哑巴)。你想让它综合判断?对不起,它没这个能力。
多模态,就是让AI同时具备"看、听、读"的能力。
说白了,多模态就是让不同类型的数据——文本、图片、音频甚至视频——能够在同一个AI系统里被统一理解。文字不再是孤立的文字,图片也不再是孤立的图片,它们被映射到同一个"语义空间"里,成为可以互相理解、互相转换的信息。
这意味着什么?
你发给AI一张产品照片,问它"这个设计风格适合年轻人吗",它能结合图片内容和你的问题给出答案。你拍一张CT片子问"有没有异常",它能看懂影像也能理解你的问题。这种"图文并茂"的交互方式,是单模态AI永远做不到的。

我之前做项目的时候,深深地感受到这个变化。以前要识别图片内容,得专门训练一个图像模型;现在有了多模态,直接问就行,省了不少功夫。
02 CLIP和视觉Token——多模态的两大关键技术
知道了多模态是什么,你肯定想问:它到底是怎么实现的?
这里有两个关键技术,必须了解一下。
第一个叫CLIP。
它的全称是"Contrastive Language-Image Pre-training",翻译过来就是"对比语言-图像预训练"。名字听起来很拗口,但原理很简单。
想象你让一个小孩学认动物。你不会让他背动物百科全书,而是给他看一堆猫的图片,告诉他"这是猫"。看得多了,他自然就知道什么是猫了。
CLIP就是这么干的。它看了几亿张图片和文字的配对数据,学会了"这张图片和这段文字说的是同一件事"。学会之后,你给它看一张它从没见过的猫的照片,它也能判断出这张图跟"a cute cat"这段文字最匹配。
这就是CLIP的作用:把图像和文本映射到同一个向量空间,让它们能够"对上号"。
类比一下,CLIP就像是一个精通多国语言的翻译官。不管你说中文还是英文,不管图片是油画还是照片,它都能翻译成同一种"语言",让你知道图片和文字说的是不是一个意思。
第二个叫视觉Token。
你可能会问:就算CLIP能理解图片和文字的关系,但LLM(大语言模型)只认识文字啊,怎么把图片喂给它?
答案就是视觉Token。
Token你可以理解为模型的"词汇"。大语言模型认识的Token都是文字形式的,一个词、一个标点都是一个Token。图片不是文字,它要怎么变成Token呢?
视觉Token就是来解决这个问题的。图片先被切分成一小块一小块,每一块被编码成一个Token。这样,一张图片就变成了一个Token序列,跟文字一样可以送进LLM处理了。
你可以把视觉Token想象成一个"切菜器"。图片是整棵白菜,直接塞不进锅里,切成白菜丝就能炒了。视觉Token就是这个切菜器,把图片切成模型能吃的"丝"。

CLIP解决的是"图片和文字能不能对上"的问题,视觉Token解决的是"图片怎么送进语言模型"的问题。
两者配合,图片才能真正被LLM理解和处理。
03 图文问答是怎么工作的?——多模态大模型的完整流程
现在你已经知道了两大关键技术。问题来了:一个具体的问题,比如"这张图里天气怎么样",AI是怎么一步步处理的?
整个流程大概分四步。
第一步,图像输入。用户上传一张图片,比如海滩度假照。
第二步,视觉编码。图片先被视觉编码器处理。这个编码器就是在CLIP等预训练模型里学过的,它知道怎么理解图像内容。编码之后,图片被转换成视觉Token序列。
第三步,图文融合。这些视觉Token和用户的文字问题("天气怎么样")一起送进LLM。在LLM内部,有一个专门的融合层,让视觉Token和文本Token充分交互、互相理解。
第四步,推理输出。LLM根据融合后的信息,推理出答案。可能是"阳光明媚,看起来是晴天"这样的文字回答。
整个过程听起来复杂,但其实跟人回答问题的过程很像。
你看到一张照片,先用眼睛捕捉信息(视觉编码),然后理解问题问的是什么(文字处理),最后结合两者给出答案(推理输出)。多模态AI模拟的就是这个过程。

这就是视觉问答(VQA,Visual Question Answering)。
你可能觉得这功能没什么稀奇,智能手机早就有了。但背后的技术已经完全不一样了。早期的视觉问答靠的是规则和模板匹配,现在的靠的是真正的"理解"——模型真的知道图片里有什么、问题在问什么,然后生成合理的回答。
这其中的关键,就是图文信息的深度对齐和融合。视觉Token和文本Token必须在同一个语义空间里才能有效对话,否则模型就是"鸡同鸭讲"。
04 不止于看图——多模态在各行各业的落地
你可能会觉得,多模态AI不就是"看图说话"吗?好像就是个玩具功能。
如果你这么想,那就太小看它了。
多模态技术正在各个行业落地,解决的都是实实在在的问题。
先说文档理解。
OCR(光学字符识别)大家应该都熟悉,就是把图片里的文字提取出来。但OCR只能提取文字,遇到表格怎么办?遇到图表怎么办?遇到发票上的印章和手写签名怎么办?
多模态文档理解就能搞定。它不仅能读文字,还能理解版式结构、图表关系、公式含义。一份年报扔进去,它能告诉你:哪里是标题、哪里是正文、哪个是表格、图表里的趋势是什么。
再说多模态RAG。
RAG(检索增强生成)是这两年很火的技术,简单说就是让AI能回答基于特定知识库的问题。但传统的RAG只能处理文字,遇到图片、表格就傻眼了。
多模态RAG解决了这个问题。文档解析阶段就能识别图片和表格,把它们也转换成可检索的形式。检索阶段,用户的问题可能是文字,但知识库里可能有图片答案——没关系,多模态技术能理解这种跨模态的关联。

我见过一个实际应用:某电商公司用多模态RAG处理商品图片和说明书。用户问"这个手机支持5G吗",AI能从说明书图片里找到答案,而不是只靠文字描述。这种能力,传统单模态RAG根本做不到。
企业用它做什么?
分析合同条款、理解财报数据、处理发票单据、审核资质材料……这些过去需要人工逐一查看的工作,现在AI可以批量处理。人只需要做最终审核,效率提升特别明显。
学术领域也在用。研究者扔进去一篇满是图表和公式的论文,AI能帮你总结关键观点、解释图表含义、回答关于论文内容的问题。
多模态,正在让AI真正成为得力的"全能助手"。
05 正视局限——多模态模型现在还不能做什么
说了这么多多模态的好话,必须来泼点冷水。
任何技术都有局限性,多模态模型也不例外。知道它不能做什么,有时候比知道它能做什么更重要。
第一个问题:幻觉。
大语言模型会"一本正经地胡说八道",多模态模型也会。
你给它看一张图片,它可能描述得头头是道,但有些细节是错的。比如图片里有3个人,它说有5个;图片是黑白的,它说是彩色的。这种"看错"或"想错"的情况,目前还无法完全避免。
第二个问题:定位不精准。
模型可能能识别出图片里有"一只狗",但你问"狗在图片的哪个位置",它就答不上来了。或者只能给出一个模糊的回答,比如"在左边"。
这种细节定位的能力,是当前多模态模型的短板之一。
第三个问题:上下文窗口限制。
这个可能比较技术,但影响很大。模型处理图片是有大小限制的,分辨率太高要被压缩,压缩太多细节就丢了。所以面对高分辨率图像或者长文档(比如几百页的PDF),模型容易顾此失彼。

这些问题怎么应对?
目前没有完美的解决方案,但有一些实践经验:重要场景不要完全依赖AI自动判断,人工复核是必要的;输入图片尽量选择合适的分辨率;问题尽量具体明确,避免让模型自己"脑补"细节。
了解局限,不是为了否定技术,而是为了更好地使用它。
就像你不会让一个刚入职的实习生独立做决策一样,对AI的能力边界心里有数,才能真正把它用好。
好,关于多模态基础的概念和原理,我们先聊到这里。
你可能会想:这些技术到底是怎么一步步实现的?CLIP和视觉Token具体是怎么配合的?有没有更详细的技术细节?
下一节课,我会带你更细致地拆解多模态模型的工作原理——看看文本、图像、音频到底是怎么在模型内部被统一理解的。
