大模型常见评测有哪些?

大模型评测指南:你的AI到底什么水平?
上篇我们聊了BLEU、ROUGE怎么给生成文本打分。但你发现没有?这些指标都只能评判"像不像",没法评判"对不对"。大模型要真刀真枪上场,光靠文本相似度可不够。
举个例子,你让AI解一道数学题,它洋洋洒洒写了一大段推理过程,最后答案是错的——BLEU分数可能还挺高。这不是AI的问题,是评测方法本身有局限。
那怎么才能全面考核一个大模型的能力?下面我们聊聊大模型评测的那些事儿。
为什么大模型需要"考试"?
先问一个问题:你能直接看出来一个大模型强不强吗?
说实话,很难。模型给你的回答看起来头头是道,但到底是真懂还是瞎编?你我这样的普通人根本分辨不了。
这就跟挑学生一样——你不能光看简历写得多漂亮,得让他做题。大模型评测,本质上就是给AI准备的标准试卷。
统一的评测基准还有一个作用:让不同模型可以比较。如果每家都自己出题,那宣传的分数根本没有可比性。评测基准就是统一的"标尺",让大家在同一套规则下比高低。
评测结果会直接影响实际决策。研究人员靠它找方向,公司靠它选供应商,投资人靠它判断技术实力。评测的权威性,直接关系到整个AI生态的走向。

评测方法论:四套"考卷"各有千秋
大模型评测的方法五花八门,但归根结底就那么几类。
第一类是选择题型——出一道题,给几个选项,让AI选。这叫判别式评测,MMLU就是这种。
优点太明显了:客观、可重复、不存在"仁者见仁"。对就是对,错就是错,AI想糊弄都糊弄不了。
但问题也很明显:真实世界里,哪有那么多四个选项摆好的题目?这种考法考不出AI真正解决问题的能力。
第二类是作文批改型——让AI生成一段文字,然后跟标准答案比对。BLEU、ROUGE用的就是这套思路。
问题来了:参考答案只有一个,但好答案可能有无数种。AI写出了更通顺、更有创意的回答,但因为跟参考答案不一样,分数反而低。这就好比你写了一篇满分作文,结果因为跟范文不一样被打了零分。
第三类是用AI来评判AI——现在很火的"LLM-as-Judge"。
具体怎么操作?让待评测的AI生成回答,然后叫来另一个更强的AI(比如GPT-4)当评委,打个分数。MT-Bench就是这套玩法。
这听起来挺合理,但问题也不少。GPT-4当评委的时候,会有自己的偏好:它可能更喜欢长的回答、更喜欢跟自己风格像的回答、甚至可能因为答案排位不同而给出不同的分数。
第四类是真人投票——让真实用户来选谁的回答更好。Chatbot Arena就是这么干的。
这是最接近真实体验的评测,但代价也最高:耗时长、成本高、很难标准化。

没有哪种方法是完美的。不同的评测场景,需要不同的方法。关键是搞清楚每种方法的适用边界。
MMLU:57门课的超级百科考试
MMLU,全称"大规模多任务语言理解",是现在最权威的大模型知识评测之一。
它涵盖了57个学科领域,从数学、物理、化学这些基础理科,到历史、法律、伦理这些人文社科,再到医学、经济学、心理学,应有尽有。题目加起来有14000多道。
这就好比让AI参加一场超级百科知识竞赛——不是考一门,是57门同时考。从小学语文到博士级专业知识,全部涵盖。
题目都是选择题,但别以为这就简单了。MMLU的题目设计本身就很有难度。很多题目需要跨学科的知识才能解答,考察的是AI真正理解和整合知识的能力。
还有个关键设计叫"零样本"——测试的时候不给任何示例,直接考。这模拟的是真实场景:你问AI一个问题,不可能先给它看几道例题。
现在最强的大模型在MMLU上已经能到90%左右。这个数字意味着什么?相当于一个专家级的水平。但问题也随之而来:分数已经很高了,继续刷分的意义有多大?这就是MMLU面临的一个尴尬——性能趋于饱和。
为了应对这个问题,后来又出了MMLU-Pro,把选项从4个增加到10个,题目难度显著提升,想刷高分就没那么容易了。

HumanEval:代码能力的上机考试
如果说MMLU考的是知识储备,那HumanEval考的就是实战能力——写代码。
HumanEval是164道编程题目的集合,每道题都有完整的函数签名、文档说明和测试用例。模型要做的,是写出能通过所有测试用例的代码。
注意这个设计有多巧妙:不是人工打分,而是让代码直接跑起来。能不能用,一跑就知道。这比任何主观评价都客观。
有个核心指标叫"pass@k"——生成k个答案,至少有一个通过测试的概率。
为什么要这么设计?因为AI生成代码有时候是靠"灵感"的。同一道题,这次生成的可能跑不通,换个prompt再试一次说不定就成了。pass@k考察的,就是模型的探索能力和多样性。
k=1的时候,就是只生成一次,有一半概率通过。k=100的时候,几乎所有有能力的模型都能通过。
但HumanEval也有局限:164道题还是太少了,而且主要是手写算法题,跟真实编程场景有差距。所以后来又有了MBPP(1000道更基础的Python题)和EvalPlus(把测试用例增加80倍)。

MT-Bench:让AI当裁判的多轮对话测试
前两个评测都是单轮问答,但真实使用中,大模型更多的是多轮对话——你问一句,它答一句,来来回回好几次。
MT-Bench就是专门设计来测试这种场景的。它有80条多轮对话数据,涵盖推理、代码、写作、数学等多个能力维度。
MT-Bench的核心创新是"LLM-as-Judge"——让GPT-4来当评委。
具体怎么操作?每个问题,模型会生成两个回答,然后GPT-4来判断哪个更好。打分从1到10,评判标准包括实用性、准确性、连贯性等多个维度。
这套方法听起来挺靠谱,但实践下来问题不少。
首先是位置偏差——GPT-4可能系统性地偏爱某个位置的答案,不管内容如何。
其次是冗长偏差——GPT-4可能更喜欢长的回答,哪怕短的回答同样准确。
还有自我强化偏差——GPT-4可能偏爱跟自己风格像的回答,给同样优秀但风格不同的回答打低分。
AlpacaEval 2.0尝试解决冗长偏差问题,用LC Win Rate(长度控制胜率)来消除长度带来的干扰。但其他偏差依然存在。

Chatbot Arena:用脚投票的真实战场
前面几种评测都是"专家打分",Chatbot Arena则是"大众投票"。
这个平台由UC伯克利等顶尖大学运营,用户可以在不知模型身份的情况下,同时跟两个模型对话,然后选择哪个回答更好。
说白了,这就是双盲测试——你不知道对面是哪个模型,模型也不知道自己在跟谁比较。完全公平竞争。
分数怎么算?用的是ELO评分系统,跟国际象棋排名一样。
简单说就是:赢了的对手分数涨,输了的对手分数跌。分数是动态更新的,经过足够多的对战,排名就会趋于稳定。
Arena-Hard是这个系统的升级版,专门收集高难度用户问题。与人类偏好的一致性能达到89.1%,已经相当高了。
但Chatbot Arena也有明显的短板:耗时长(积累足够数据可能需要几周),成本高(需要大量真实用户参与),难以标准化(用户偏好本身就很多样)。

评测那么多,你该信哪个?
说了这么多评测方法,你可能会问:到底该信哪个?
说实话,每种评测都有它的适用场景和天然缺陷。MMLU反映的是知识储备,HumanEval反映的是代码能力,MT-Bench反映的是对话质量,Chatbot Arena反映的是用户体验。
如果一个模型宣传自己"超越GPT-4",先别急着信。追问一句:在哪个评测上?用什么标准?用的什么测试条件?
这种追问的能力,比记住所有评测指标重要得多。
看完这些评测,你会发现一个规律:评测越接近真实体验,成本就越高;评测越容易标准化,就越可能偏离实际需求。这是一个永恒的矛盾,没有完美的解决方案。
但也正因为如此,理解评测体系背后的逻辑,比记住分数更重要。你得知道每个数字是怎么来的,才能判断它到底意味着什么。
说到评测,我有个感受挺深的——去年帮一家创业公司选模型,他们的技术负责人甩给我三份评测报告,每份都宣称"全面超越GPT-4"。结果我一追问具体测试条件,对方就开始含糊了。后来我自己跑了几个评测,发现实际情况跟宣传差距不小。
所以啊,看评测报告一定要看细节,别被数字唬住。
下一期我们会聊一个更具体的问题:RAG系统怎么评测?检索命中率、忠实性、支撑度,这些指标到底在说什么?如果你对怎么评估AI的"知识准确性"感兴趣,这期一定不要错过。
