错的是裁判,不是考生:AI评测的尺子裂了
分数跳水不一定是模型退步,分数暴涨也不一定是模型进步。有时候只是裁判错了。

31个百分点的跳变
先说事情本身。arXiv 在 9 月 11 日收录了一篇编号 2609.13009 的论文,做的事听起来不太性感,但相当要命:请领域专家逐题复核六个主流物理基准的评分结果。
复核前,GPT-5.6-Sol 在 HLE-Physics 上的 mean@4 得分是 47.3%。这个数字此前被反复引用,用来论证「前沿模型离真正的物理能力还有明显差距」。
专家们翻查后发现,大量被判错误的答案,问题出在评分器(grader)身上。有的评分脚本写得太粗糙,模型换个说法就识别不出;有的参考答案本身就有缺陷,模型的推理其实是对的,分却被扣了。把评分修正之后,同一个模型、同一套题,分数跳到 78.7%。
从 47.3 到 78.7,中间没有模型升级,没有多烧一张 GPU,也没有新数据。只是把裁判的错判改了过来。另一套基准 CritPt 上,保留题的 pass@4 达到了 94.4%。
我第一次看到这组数字,谈不上震惊,更像迟到的证实。自己动手跑过评测的人多少都遇到过这种场面:模型明明答对了,LLM judge 偏说它错了,你盯着评分日志看半天,最后发现是判分 prompt 里漏写了一个约束条件。单个看是琐碎的工程问题,攒在一起就是一场行业级的测量事故。
而绝大多数评测结果发布的时候,没人做这道复核工序。

尺子裂在哪几个地方
把这次审计暴露的问题归类,大致四种:
- 评分器误判。自动判分脚本(正则匹配、字符串比对、LLM judge)理解不了模型的等价表述,把对的判成错的。这是大头。
- 参考答案缺陷。标准答案本身就错,或者只在某一种表述下成立。模型越是把问题从另一个角度讲清楚,越容易被冤枉。
- 题目歧义。一道题存在多种合理解读,模型选了其中一种,评分只认另一种。
- 聚合指标放大误差。
mean@4、pass@4这类指标会把单题误判成倍放大到总分上,一道错判题就能拖动几个百分点。
这四种没有一种是技术难关,全是工程和质量管理层面的活儿。可偏偏就是这些活儿,决定了外界怎么看整个行业的能力边界。
另一面:医学AI的镜子
如果说物理审计说明我们可能低估了模型的能力,同一批 arXiv 里的另一篇论文(2609.12718,When Rubrics Fail)照出的就是反方向。
这篇研究盯的是医疗AI评测里的评分标准(rubric)。结论不客气:当 rubric 本身失效时,模型的幻觉问题会被系统性低估。换句话说,体检报告不光可能冤枉好学生,还可能放过带病的那个。

两篇论文出现在同一份 arXiv 列表里,我觉得有种说不出的讽刺。一边证明尺子把好学生量矮了,一边证明尺子把不合格的学生放过了。根源是同一个:我们太信任自动评分这套基础设施,信任到从不给它做一次正经的代码评审。
两种失真的后果还不对称。低估能力,代价是舆论和投资变保守,研究资源错配。高估可靠性,出事的地方是诊室和手术室。后者要命得多。
| 失真方向 | 证据来源 | 直接后果 |
|---|---|---|
| 低估模型能力 | 物理基准审计:评分器错误压分,47.3%→78.7% | 行业进度被误读,资源错配 |
| 高估模型可靠性 | 医疗AI研究:rubric 失效,幻觉漏检 | 高风险场景的部署建立在虚高的安全感上 |
评测才是地基,可地基没人验收
行业愿意为算力一掷几十亿美元,却舍不得给评测脚本安排一次像样的质检,这事儿想想挺荒诞。分数是整个行业的公共记分牌,记分牌本身却常年没人校准。
我们习惯追问「模型有多聪明」,却很少追问「这个分数是谁打的,打分的程序自己及格了吗」。
往后看,我觉得有几件事值得做,而且都不难:
- 发布分数时同步公布评分器审计结果:抽了多少题、人工复核比例、发现多少误判。没有这些上下文的分数,参考价值要打折。
- LLM judge 的判分本身也要抽检,尤其是边界案例。judge 也是模型,也会犯错,也会幻觉。
- 对任何「分数跳变」保持怀疑,无论方向。暴涨先查评分器,暴跌再怀疑模型。
- 别拿单一基准下结论。六个基准里五个都有毛病的话,新闻稿里那个数字什么也说明不了。
物理审计的作者团队说得很直白:现有基准需要更难的、专家级的评测题。我补一句自己的判断——比更难的题更急迫的,是更可信的判分。题难了判分烂,只会造出更大的噪声。
评测是AI行业的度量衡。度量衡失准的时候,最先失真的不是模型排名,而是我们对自己走到了哪里的判断。47.3%到78.7%之间的距离,不是模型走过的路,是评分器欠下的账。