术语表

基准测试(Benchmark)

最后更新:2026-07-08

**基准测试(benchmark)**是一套带评分规则的固定任务,用来测量一个 AI 模型的能力并与其它模型比较。模型发布会上的每个数字——「SWE-bench Verified 80.9%」「Arena 第一」——都是基准结果。它存在的原因很朴素:不先约定考什么,「哪个模型更聪明」就无从回答。

主要类型

知识与推理考试(GPQA、MMLU、AIME)考察有标准答案的事实与解题。任务型基准让模型干真活打分——SWE-bench 让模型修真实的 GitHub issue;Terminal-Bench 让智能体在命令行里完成工作;OSWorld 考察看截图操作电脑。偏好排行榜(LMArena 的 Elo 体系)干脆不设标准答案:人类盲评两个模型的输出并投票,模型像棋手一样按胜率排名。图像、视频这类媒体模型几乎只能靠这种方式——「哪段视频更好看」没有 ground truth。

分数为什么会骗人

三种失效反复出现。数据污染:基准题目泄漏进训练数据,模型「背过」答案而非推理出来。饱和:前沿模型挤在 90 分以上后,剩下的差距基本是噪声——这正是基准不断被更难的后继者取代的原因(MMLU → GPQA,SWE-bench → SWE-bench Pro)。执行框架敏感:同一个模型换个脚手架、工具集或重试预算,分数就不一样——两家实验室在「同一个」基准上同时宣称第一,通常就是这么来的。模型还可以被微调去适配某个基准的题型而不获得通用能力——工业规模的应试教育。

正确的打开方式

把基准当筛选器,别当判决书。看清版本和日期(SWE-bench Pro 不是 SWE-bench Verified);中立框架跑出的数字优先于厂商自报;优先看跟你的工作负载相似的基准——编程领先说明不了写作质量。我们的最佳榜单给每条论断标注具体基准出处,原因正在于此。最终的检验从来只有一个:拿你自己的任务跑一遍。基准能告诉你的,只是哪些模型值得你花那一小时。

来源

← 全部术语