AI 应用怎么评测?

AI 应用怎么评测?光看准确率可能害死人
你有没有遇到过这种情况:模型评测报告漂亮得不像话,准确率 95%、F1 分数 98%,团队庆祝了三分钟。结果上线第一天,用户反馈写满了投诉——“答非所问”、“语气太冷”、“关键时刻掉链子”。
这不是技术不行,是评测体系缺位。
上篇文章我们聊了 RAG 系统怎么用 MRR、NDCG 这些指标量化评测。这套方法对特定场景很有效,但问题是——AI 应用远不止 RAG 一个场景。当你面对一个客服机器人、一款写作助手、或者一个代码生成工具时,光靠几个技术指标根本罩不住。
为什么?因为 AI 应用评测的复杂度,比传统软件高了不止一个量级。
传统软件只有对错,AI 应用还要看"好不好"
你测一个登录功能,要么能登录要么不能,黑白分明。但 AI 应用不一样,回答"北京天气怎么样"可能有二十种都对的方式——有的简洁、有的详细、有的带点幽默、有的过于正式。
你说哪个更好?标准答案是"看场景"。但问题是你怎么量化这个"看场景"?

这就是 AI 评测的第一个坑:评估维度从 0 和 1 变成了光谱。
更坑的是,很多评估指标本身就是主观的。你让三个专家评估同一段 AI 生成的法律建议,可能得到三种不同的分数。怎么办?
我的经验是:先从简单评估着手。与其一开始就追求完美评测体系,不如先搭一个能跑起来的基准。哪怕粗糙,至少能发现明显退化。等团队有感觉了,再逐步加入更多维度。
很多团队犯的错是:评测太复杂搞不动,最后干脆不测了。这比测得糙危害大得多。
三层评估框架:离线、在线、运行时
好,你现在想认真做评测了。第一件事是什么?
建立分层意识。AI 应用评测不是一道菜,而是一桌席。不同阶段需要不同的评测策略。
简单说,AI 应用的质量保障分三层:
第一层:离线评估。模型上线前,在你的测试数据集上跑一遍。这个阶段的特点是:可控、批量、可重复。像考前做模拟题,反复练直到心里有数。
第二层:在线评估。模型上了灰度,用真实流量的一小部分试探。这个阶段的特点是:真实但有风险。像模拟考试,考完老师还要批改。
第三层:运行时评估。模型正式对外服务,实时监控质量,发现问题立刻告警。这个阶段的特点是:实时、持续、不能出错。像期末正式考试,分数直接影响 GPA。

为什么要分三层?
因为每个阶段解决的问题不一样。离线评估解决"能不能用"的问题,在线评估解决"好不好用"的问题,运行时评估解决"一直好用吗"的问题。
漏掉任何一层,迟早出事。
我见过只做离线评估的团队,上线后才发现用户体验完全不对路。也见过只靠线上反馈的团队,用户都跑光了才发现模型退化了。更见过运行时监控都没有的团队,出了重大事故才后知后觉。
三层评估就像汽车的安全带、气囊、刹车辅助。你可以说"我有安全带就够了",但没人会真的这么做。
离线评估实战:没有参考答案的练习都是自欺欺人
好,我们从最基础的离线评估开始聊。
离线评估的核心是黄金数据集。这东西就像参考答案——没有它,你的每次测试都是在猜自己对不对。
怎么建黄金数据集?
第一步,找专家要困难查询。别拿常规问题糊弄,要找那些容易踩坑的边界case。比如问"糖尿病患者能不能吃西瓜",标准回答应该是"可以吃但要控制量",错误回答是"不能吃"或者"随便吃"。
第二步,专家给每个问题标注参考文件或标准答案。这个过程很耗时,但必须做。没有标准答案,你的评测结果就是玄学。
第三步,把数据集版本冻结。每次模型更新都用同一套题考,分数才有可比性。最怕的是每次测试换题库,分数忽高忽低找不到原因。

这里有个实用技巧:检索指标是 RAG 评测的关键。
之前我们讲过 MRR 和 NDCG,这两个指标专门衡量检索质量。RAG 系统的上限由检索决定——如果检索返回的都是错误文档,再强的生成模型也救不回来。
另一个实用技巧是用 embedding 匹配验证引用真实性。很多 AI 应用喜欢引用法律条文或者学术论文,你怎么知道它没瞎编?用 embedding 把引用内容和真实语料库匹配一下,一目了然。这个方法比人工核查高效一百倍。
最后说说每日 canary evals。这个概念来自 Google:每天跑一个小规模测试,验证当天代码改动有没有引入退化。规模小、成本低、反馈快。发现问题当天修,别等积累成大 bug。
人工评估:什么时候必须用真人?
离线评估搞定了,是不是可以直接上线了?
未必。有些场景,人工评估是必须的。
什么场景?高风险场景。
法律咨询、医疗建议、金融分析,这些领域出错了可能要命。纯自动手段很难捕捉推理过程中的细微瑕疵——模型可能推理步骤都对,但结论在某个边界条件下刚好踩雷。这种问题,只有领域专家能看出来。
那人工评估怎么做?
两个常用方法。并排对比:让专家同时看两个模型的输出,选哪个更好。打分评估:按维度打分,通常 1-7 分。为什么是 1-7 不是 1-10?因为心理学研究告诉我们,7 点量表最稳定,分太多档专家也区分不了。

防偏差也很重要。专家评分容易被顺序效应影响——先看 A 再看 B,往往更倾向于 A。用随机顺序、控制题目数量、匿名评分,这些手段都能提升评估质量。
人工评估还有一个变体:用户本身就是评估者。
比如你让用户审核 AI 生成的内容,不满意就点"重新生成"。这种 Human-in-the-Loop 的方式,既是交互优化,也是评估数据积累。用户帮你发现问题,比雇专家便宜多了。
但人工评估有个致命弱点:无法大量、实时进行。你不可能雇一千个人 24 小时给你打分。
怎么办?用 LLM 自动评估器。但别把它当万能药——LLM 评估器能扩展评估规模,却可能引入自己的偏见。高风险场景,人工兜底不能省。
线上反馈:让用户帮你发现问题
好了,离线评估通过,人工评估也过了。现在总可以上线了吧?
可以,但你还得装一套实时监控系统。
线上反馈的核心是持续跟踪质量趋势。不是等用户投诉了才发现问题,而是在投诉之前就察觉端倪。
具体怎么做?
第一步,线上抽样打分。不是所有用户反馈都要人工看,那样成本太高。随机抽样 1% 的对话,让标注员打分,跟踪整体质量趋势。如果分数开始下滑,立刻告警。
第二步,设置质量阈值。比如"回答满意度低于 85%"就触发告警。不是等掉到 60 分才着急,85 分就该警觉了。问题越早发现越好修。
第三步,A/B 测试每个变更。几乎每个模型更新都要做 A/B 测试。流量分两组,一组用新模型一组用旧模型,看关键指标有没有提升。金融等高风险场景,更要把离线评估和在线评估结合起来用。

A/B 测试有个坑要避开:别只看短期指标。
新模型可能短期指标更好,但长期用户留存反而下降。为什么?可能是新模型更会讨好用户,但回答质量反而下降了。或者是新模型在某些边界 case 上退化,普通测试发现不了。
所以 A/B 测试的周期要足够长,通常建议至少两周。同时要看多个指标,不能只看转化率这种业务指标,用户体验指标也要兼顾。
三种评估如何协同?构建评测飞轮
讲了这么多,你可能会问:到底怎么把这三种评估串起来用?
答案是构建评测飞轮。
所谓飞轮,就是评估驱动优化,优化产生新数据,新数据反哺评估。这个循环越转越快,AI 应用的质量就越来越高。
具体怎么转?
离线评估负责覆盖广。用黄金数据集验证模型在各类场景下的表现,发现问题后针对性优化。这个阶段成本低、速度快,适合频繁迭代。
人工评估负责深度足。在高风险场景下,人工判断是最后一道防线。同时,人工评估的结果可以反馈到离线数据集,持续扩充黄金数据集的边界 case。
线上反馈负责真实。真实用户的行为数据是最客观的评估。把线上发现的高频问题加入离线数据集,把用户好评的回答作为标杆案例,这个闭环让评测体系越来越完善。

这里有个关键点:评测集先行于训练集。
什么意思?在你用新数据训练模型之前,先把这批数据加入评测集。否则你就是闭眼考试——不知道自己到底提升没有。
另外,LLM-as-Judge 是扩展评估的神器,但别迷信它。LLM 能帮你低成本、大规模地做初步筛选,但它本身也有偏见。在高风险场景下,LLM 的判断只能作为参考,最终决策还是需要人工确认。
这个系列讲完了,然后呢?
写到这儿,这个系列差不多该收尾了。
我们从大模型是什么开始,聊到了模型为什么会变笨(RAG 退化),最后聊到了怎么系统性地评测 AI 应用。这条线串起来,就是一个 AI 应用从训练到上线的质量保障思路。
但问题是:评测做完了,然后呢?
评测只是手段,不是目的。真正的目标是持续迭代。
你有没有想过,那些 AI 应用的迭代飞轮转得特别快的公司,到底做对了什么?他们的评测体系有什么共同特点?
这可能是下一个值得深挖的话题。但今天这篇文章,已经给了你足够多的工具箱。
没有完美的评测体系,只有不断完善的评测体系。先把框架搭起来,哪怕是粗糙的。然后让它转起来,在转动中迭代。这个过程没有终点,但每一步都让你离"好 AI"更近一点。
这个系列告一段落了。如果你有具体场景的评测困惑,欢迎继续交流。
