大模型评测榜单

小伙伴们肯定会问:“大模型这么多,咱们普通人到底怎么知道哪个更好用?有什么评判标准码?”

你肯定不能光听各家厂商发布会上的自卖自夸——“我们的模型又一次刷新了世界纪录” 这种话吧?因为这样的话,每一家都在说。如果想要客观地比一比,就得靠相对公正的评测榜单。

目前给大模型打分、排名,主要有两条路线:一条是 “做题家” 路线(让模型考试),另一条是 “打擂台” 路线(让真人投票)。接下来,咱们一条条来看。

大模型能力评测榜单的两条主流打分路线图解:一条是让大模型做标准基准考卷的客观做题测试路线,另一条是让真实用户匿名对决打擂台的盲测投票路线

第一条路线:让模型 “考试”(基准测试)

第一种办法最直观:出一套标准考卷,让各家模型都来做,谁分数高谁就强。这套 “标准考卷”,业界叫它 “基准测试(Benchmark)”。

这些考卷往往分门别类,专测某一项能力。比如:

  • MMLU:考综合知识,题目横跨历史、法律、医学等几十个学科。
  • GSM8K:专考数学应用题。
  • HumanEval:专考写代码的能力。

这种方式的好处很明显:客观、可复现、又快又便宜——给个分数,高下立判。

但它有个绕不开的大坑,叫 “刷榜”(专业点说,叫 “数据污染”)。考卷的题目大多是公开的,万一某个模型在训练时正好 “背” 过这套题的答案,那它考高分,就跟 “考前泄了题” 没两样,并不能真实反映它的水平。

另一个问题是:考试考得好,不等于聊天好用。一个模型可能很会做题,但实际聊起来啰里啰嗦、又不解风情,跟个直男一样。于是,就有了第二条路线。

大模型基准测试路线:MMLU、GSM8K 与 HumanEval 考试刷榜原理解析

第二条路线:让真人 “打擂台”(盲测投票)

既然想看的是 “好不好用”,那最实在的办法,就是直接让真实用户来投票。这条路线最有名的代表,就是 “LMSYS Chatbot Arena”(如今已经改名叫 “Arena”),中文常叫它 “大模型竞技场”。

提示: Arena 官方地址为:https://arena.ai/leaderboard。

它是 2023 年由加州大学伯克利分校、斯坦福大学等联合打造的,它的玩法非常巧妙:

  • 你在网站上随便提一个问题。
  • 系统把这个问题,同时发给两个匿名模型(你并不知道它俩是谁)。
  • 两个回答并排摆在你面前,你投票选出更好的那个。
  • 全球海量用户的投票汇总起来,就算出了每个模型的分数和排名。

这里的关键词是 “盲测”——投票时,你压根不知道哪个回答出自哪家模型,所以你只会凭 “答得好不好” 来选,而不会被品牌牵着走。

它给模型打分,用的是一套源自国际象棋的 “Elo 积分” 系统。道理和棋手排名一样:你赢了一个强对手,加分多;赢了个弱对手,加分少。几百万张投票下来,每个模型的分数就慢慢稳定了。

这个分怎么读?举个直观的例子:如果 A 模型比 B 模型高出 100 分,大致意味着在两者的正面对决里,A 有约 64% 的概率胜出。分差越小,说明两者越接近;只差个十来分,基本就可以看作旗鼓相当了。

大模型 Arena 盲测投票机制:真人匿名对决打擂台与 Elo 积分排名系统

为什么大家更相信 “打擂台”?

和 “考试”(基准测试)比起来,“打擂台”(盲测投票)有 2 个突出的好处:

  • 贴近真实:大家提的都是五花八门的真实问题,而不是死板的考题,最能反映模型平时到底好不好用。
  • 难以作弊:题目是全球用户现场出的、又是匿名对战,模型没法提前 “背答案”。

正因如此,Arena 的排名,被很多人看作衡量大模型真实水平最有参考价值的榜单之一。

盲测打擂台的优势:贴近真实用户问题且难以作弊的大模型客观评测标准

看榜单时,要注意什么?

不过,榜单虽好,但也不能全信。我们看的时候记住下面几点,就不容易被带偏。

1. 名次每天都在变,别去背它

这类榜单是实时滚动更新的,新模型一发布,过个一两周排名就可能大洗牌。所以别去记 “谁是第一”,需要时直接上官网(https://arena.ai)看最新的就行。

2. 前几名往往 “咬得很紧”

排在最前面的几个模型,分数常常只差几分,统计上几乎算平手。这种时候,与其纠结谁第一谁第二,不如把前几名都拉出来,用你自己的实际任务挨个试一试。

3. 投票会被 “风格” 带偏

真人投票也有它的小毛病:人们有时会偏爱那些答得更长、排版更花哨的回答,哪怕内容未必更对。所以高分不完全等于 “更正确”,只能说 “更讨人喜欢”。(榜单方也意识到了这点,专门做了 “风格无关” 的校正来尽量抵消它。)

4. 要分门别类地看

现在的榜单已经拆得很细了——写代码、数学推理、长文本、多语言、图像生成、视频生成等,各有各的排行榜。我们要拿 AI 写代码,就重点看 “编程” 那个分榜,而不是只盯着综合总榜。

查看大模型评测榜单的注意事项:名次波动、分数接近、风格偏差与细分榜单

提示: 除了 Arena 之外,国内也有专门面向中文场景的评测榜单(比如 SuperCLUE 等)。我们在挑模型时,多参考一两个评测来源、再结合自己的实际需求,比死磕单一榜单要靠谱得多。

总结一下:给大模型排名次,“考试”(基准测试)看的是硬知识、胜在客观。“打擂台”(盲测投票)看的是真体验、胜在贴近实战,两者结合着看最好。但说到底,榜单只是个参考——最适合你的那个模型,永远要靠你拿真实任务亲手试出来。

结合基准测试与打擂台盲测:如何通过真实任务选型最适合的大模型

不过还是要提醒一句:这个领域变化实在太快,几乎每隔几周就有新模型、新排名冒出来。咱们这篇文章写的只是一个阶段性的 “快照”,等你读到时,说不定又杀出了新的黑马。所以小伙伴们没必要死记名字,重点是看懂这个生态的格局和趋势。

此外,除了主流的评测榜单之外,还有很多有意思的评测榜,比如 “大模型高考排行榜”:就是每年的高考之后,都会有一部分人会使用当年的高考试卷,来对主流大模型进行评测,看看哪家得分最高。

比如 2026 年的 “大模型高考成绩排行榜”,如下图所示。

大模型趣味评测榜单:2026 年大模型高考成绩排行榜,使用真实高考试卷对主流 AI 模型进行测试打分的实测截图

上一篇:

下一篇:

给站长反馈

绿叶网正在不断完善中,小伙伴们如果发现任何问题,还望多多给站长反馈,谢谢!

邮箱:lvyenet@vip.qq.com

「绿叶网」服务号
绿叶网服务号放大
关注服务号,微信也能看教程。
绿叶网服务号