评测指标

合集文章导航
本合集共 6 篇文章,涵盖 AI 评测核心知识:
- AI 模型评测到底评什么? - 准确性、鲁棒性和可用性
- 分类任务怎么评估? - Accuracy、Precision、Recall 和 F1
- 生成任务怎么评估? - BLEU、ROUGE、BERTScore
- 大模型常见评测有哪些? - MMLU、HumanEval、MT-Bench 和 Arena
- RAG 系统怎么评测? - 检索命中率、忠实性、支撑度
- AI 应用怎么评测? - 离线评测、人工评估和线上反馈
AI模型到底好不好?先搞懂评测指标体系
你有没有遇到过这种情况?
训练了三天三夜的模型,论文里写 accuracy 98%,自己一跑心里却没底。
这98%到底是真的厉害,还是恰好遇到的数据都比较简单?
老板问你"这个模型能用吗",你除了说"效果不错",还能说出哪里不错、不错多少吗?
这就是今天要解决的问题——怎么科学地评价一个AI模型。
评测为什么是AI发展的"指挥棒"
AI模型训练完了,怎么知道它好不好?
靠感觉?
不行。感觉会骗人。
得靠数据说话,靠指标说话。
但很多人只关注"怎么训练",忽略了"怎么评测"。
这里有个真实的例子。2012年的ImageNet挑战赛设置了统一的评测标准和数据集,全球研究者开始在这个框架下竞争。错误率从26%一路降到3%,直接催生了整个计算机视觉领域的爆发。
评测不只是"打分",它塑造了研究方向。它告诉开发者:这个问题值得解决,这个指标值得优化。
没有评测,AI发展就是一团浆糊。有了评测,才有了可比较的基准、可复现的成果、可量化的进步。
所以评测不是终点,而是起点。它是AI发展的"指挥棒"。

评测到底评什么?两个维度说清楚
AI评测听起来很简单,找几个指标算一算呗。但真要系统理解,得从两个维度来看。
第一个维度是任务类型。
你的AI是做什么的?
分类任务,就是判断对错——这张图是猫还是狗,这封邮件是不是垃圾邮件。
生成任务,就是产出内容——写文章、作画、对话、代码。
理解任务,就是综合能力——读懂一段话的含义,回答复杂问题。
不同任务,评测的思路完全不同。
第二个维度是评估层面。
技术指标层面,看精度、速度、内存占用——这是给开发者看的。
用户体验层面,看输出质量、交互流畅度、有没有硬伤——这是给用户看的。
业务价值层面,看能不能省钱、能不能赚钱、能不能解决实际问题——这是给老板看的。
一个垃圾邮件分类器,技术指标再漂亮,用户一打开收件箱发现重要邮件被误删了——这模型就没价值。医学诊断AI,诊断准确率99%,但每次诊断要等一天——医院根本不会用。
所以评测不能只看一个数字。要像体检一样,做全套检查,各项指标综合判断。

本系列的后续6篇文章,就是围绕这两个维度展开的。分类任务怎么评,生成任务怎么评,大模型有什么特殊评测,RAG应用怎么端到端验证。每个板块都会深入讲透一个领域。
分类任务评测:非黑即白的判断题
先从最简单的开始——分类任务。
分类任务本质上就是做判断题。这张图是猫还是狗?这句话是正面评价还是负面评价?答案只有对和错,没有中间地带。
那怎么评?
最直觉的指标是准确率(Accuracy):所有预测里,预测正确的占了多少比例。公式很简单:正确数除以总数。
听起来很完美对吧?但准确率会骗人。
假设你做了一个癌症筛查模型,数据里99%的病人是健康的,只有1%真的得了癌症。模型直接预测"所有人都是健康的",准确率99%。厉害吧?但这模型有什么用?它一个癌症患者都没筛查出来。
这就是类别不平衡的问题。准确率在balanced数据上很好用,但在imbalanced数据上会被轻易欺骗。
这时候需要更精细的指标。
Precision,中文叫"精确率"。意思是:你预测为正的样本里,有多少是真的阳性?
比如模型说10个人得了癌症,这10个人里真的有几个是癌症?Precision高,意味着"宁缺毋滥",预测出来的大概率是对的。
但Precision高不一定好。Recall,中文叫"召回率"。意思是:所有真正的阳性样本里,你找出来了多少?
比如100个癌症患者,你预测出了几个?Recall高,意味着"宁可错杀不可放过",尽量不漏诊。但可能把很多健康人也预测成阳性。
两个指标往往此消彼长,需要F1分数来平衡。F1是Precision和Recall的调和平均,单独一个高不算高,两个都高F1才高。
那怎么直观理解这三个指标?想象你在做癌症筛查。高Precision意味着:筛查阳性的人,大概率真的是癌症,可以安排进一步检查了。高Recall意味着:尽量不漏掉任何一个可能的患者,哪怕多误诊几个也好。F1则是两者的综合评估。

生成任务评测:见仁见智的作文题
分类任务评的是"对不对",生成任务评的是"好不好"。这个难度就大多了。写一篇文章,没有标准答案。你说写得好,他说一般,谁说了算?
机器翻译就是一个典型例子。"今天天气真好"翻译成"Today is a nice day"还是"The weather is nice today"?都对,但不完全一样。到底哪个更好?
最早的做法是看"词汇重叠"。把机器翻译和参考答案的词一个个比对,数有多少重合。BLEU就是这种思路,它数n-gram的重叠程度——连续2个词、3个词、4个词的重叠。重叠越多,分数越高。
但这有个问题。同义词不算重叠,"good"和"nice"不一样,"beautiful"和"nice"也不一样。但人类能理解它们是相似的意思。"今天的天气很好"和"The weather is nice today"语义相同,但BLEU分数可能很低。
后来有了BERT派的方法,不再比词汇,而是比语义。把句子encode成向量,在语义空间里计算相似度。这样"很好"和"nice"就能匹配上了。这就是BERTScore的思路。
但问题来了。再好的算法,也评价不了"文章立意高不高"、"句子有没有文采"。批改作文,机器可以检查错别字和病句,但文章写得好不好、有没有真情实感,还得人来打分。
所以生成任务的评测,自动化指标是辅助,最终质量的判断,必须有人工评估参与。

大模型专属评测:超越单项能力的综合考验
说完了传统的分类和生成任务,该聊大模型了。
大模型跟传统AI不一样。它不是解决一个特定问题,而是能干很多事情。写代码、聊天、写作、分析数据、翻译、做数学题……传统的单项评测不够用了。
你不能说"我的模型翻译很厉害",因为用户可能更关心它的推理能力。大模型需要综合评测。
那怎么测?
先看知识储备。MMLU就是个典型代表,57个学科的选择题,从数学到历史到法律到医学。考的就是"这个模型脑子里装了多少知识"。类似人类的知识竞赛。
但光有知识不够,还得会用。HumanEval专门测编程能力,给你一个函数签名和文档字符串,让你补全函数体。125道题,涵盖各种编程场景。这就不仅是背知识了,而是应用能力。
还有一类是测推理。MT-Bench用多轮对话考察复杂推理和指令遵循,问一个需要多步思考的问题,看模型能不能答对。光有知识、会写代码还不行,还得"脑子转得快"。
最后还有主观偏好。Arena模式,靠人类投票排名,把两个模型的回答给人类看,人类选哪个更好。谁的答案更实用、更有帮助、更有道理。这种方式测的是"用户真实感受",没法靠标准答案。

从实验室到生产:RAG与AI应用的完整评测
理论讲完了,该聊落地了。再厉害的模型,也要能用才行。
RAG(检索增强生成)是现在最火的AI应用架构。简单说就是:先检索相关资料,再让大模型基于资料生成答案。这个架构怎么评测?分两层。
第一层是检索层。检索有没有命中?召回率是多少?用户问的问题,相关文档有没有被找出来?
第二层是生成层。生成的内容有没有忠实于检索到的资料?有没有"幻觉"——瞎编乱造?回答跟用户问题相关性怎么样?
这就需要同时考核多个指标。检索指标看召回率和命中率,生成指标看忠实性、相关性、有没有有害内容。
光靠指标还不够。离线指标可以快速迭代,筛选掉明显的bad case,但最终质量还得人工评估——让标注员打分,判断回答好不好。
最后一步是线上验证。小流量上线,做A/B测试,看真实用户的反馈。指标有没有提升?用户留存有没有变化?
三个阶段缺一不可。实验室测试→用户内测→公开Beta,环环相扣。

评测思维:从调参侠到AI工程师的跨越
说了这么多评测指标,你发现没有?评测不是最终目的,评测是为了优化。
你知道了Precision不够高,下一步是分析为什么不高、怎么提高。你发现了幻觉问题,下一步是加什么护栏、加什么约束。评测是闭环的一部分。
训练→评测→分析→优化→再训练→再评测……持续迭代,才能做出真正可用的AI。
很多人觉得AI工程师就是调参、炼丹。其实真正的AI工程师,是能用数据驱动决策的人。不是"我觉得这样好",而是"指标显示这样更好"。不是"应该没问题",而是"测试集上达到了99%的准确率"。
这种量化思维,才是AI工程师的核心能力。掌握了评测思维,你就从"调参侠"进化为真正的"AI工程师"。
本系列的后续文章,会带你深入每一个评测细节。分类任务怎么选指标,生成任务怎么平衡自动化和人工评估,大模型有哪些专属评测方法,RAG系统怎么端到端验证。每篇文章都会掰开了揉碎了讲。
但不管讲多少,核心思想就一个:用数据说话,用指标驱动优化。
下一篇文章,我们从最基础的开始聊——AI模型评测到底评什么?准确性、鲁棒性和可用性,这三个词分别是什么意思?
准备好了吗?
