错的是裁判,不是考生:AI评测的尺子裂了

错的是裁判,不是考生:AI评测的尺子裂了

分数跳水不一定是模型退步,分数暴涨也不一定是模型进步。有时候只是裁判错了。

错的是裁判,不是考生:AI评测的尺子裂了

31个百分点的跳变

先说事情本身。arXiv 在 9 月 11 日收录了一篇编号 2609.13009 的论文,做的事听起来不太性感,但相当要命:请领域专家逐题复核六个主流物理基准的评分结果。

复核前,GPT-5.6-Sol 在 HLE-Physics 上的 mean@4 得分是 47.3%。这个数字此前被反复引用,用来论证「前沿模型离真正的物理能力还有明显差距」。

专家们翻查后发现,大量被判错误的答案,问题出在评分器(grader)身上。有的评分脚本写得太粗糙,模型换个说法就识别不出;有的参考答案本身就有缺陷,模型的推理其实是对的,分却被扣了。把评分修正之后,同一个模型、同一套题,分数跳到 78.7%

从 47.3 到 78.7,中间没有模型升级,没有多烧一张 GPU,也没有新数据。只是把裁判的错判改了过来。另一套基准 CritPt 上,保留题的 pass@4 达到了 94.4%。

我第一次看到这组数字,谈不上震惊,更像迟到的证实。自己动手跑过评测的人多少都遇到过这种场面:模型明明答对了,LLM judge 偏说它错了,你盯着评分日志看半天,最后发现是判分 prompt 里漏写了一个约束条件。单个看是琐碎的工程问题,攒在一起就是一场行业级的测量事故。

而绝大多数评测结果发布的时候,没人做这道复核工序。

老实验室里的测量仪器,仪器不准,读数再漂亮也没用

尺子裂在哪几个地方

把这次审计暴露的问题归类,大致四种:

  1. 评分器误判。自动判分脚本(正则匹配、字符串比对、LLM judge)理解不了模型的等价表述,把对的判成错的。这是大头。
  2. 参考答案缺陷。标准答案本身就错,或者只在某一种表述下成立。模型越是把问题从另一个角度讲清楚,越容易被冤枉。
  3. 题目歧义。一道题存在多种合理解读,模型选了其中一种,评分只认另一种。
  4. 聚合指标放大误差。mean@4pass@4 这类指标会把单题误判成倍放大到总分上,一道错判题就能拖动几个百分点。

这四种没有一种是技术难关,全是工程和质量管理层面的活儿。可偏偏就是这些活儿,决定了外界怎么看整个行业的能力边界。


另一面:医学AI的镜子

如果说物理审计说明我们可能低估了模型的能力,同一批 arXiv 里的另一篇论文(2609.12718,When Rubrics Fail)照出的就是反方向。

这篇研究盯的是医疗AI评测里的评分标准(rubric)。结论不客气:当 rubric 本身失效时,模型的幻觉问题会被系统性低估。换句话说,体检报告不光可能冤枉好学生,还可能放过带病的那个。

被逐字审视的文字,正是评分器每天在做的事

两篇论文出现在同一份 arXiv 列表里,我觉得有种说不出的讽刺。一边证明尺子把好学生量矮了,一边证明尺子把不合格的学生放过了。根源是同一个:我们太信任自动评分这套基础设施,信任到从不给它做一次正经的代码评审。

两种失真的后果还不对称。低估能力,代价是舆论和投资变保守,研究资源错配。高估可靠性,出事的地方是诊室和手术室。后者要命得多。

失真方向 证据来源 直接后果
低估模型能力 物理基准审计:评分器错误压分,47.3%→78.7% 行业进度被误读,资源错配
高估模型可靠性 医疗AI研究:rubric 失效,幻觉漏检 高风险场景的部署建立在虚高的安全感上

评测才是地基,可地基没人验收

行业愿意为算力一掷几十亿美元,却舍不得给评测脚本安排一次像样的质检,这事儿想想挺荒诞。分数是整个行业的公共记分牌,记分牌本身却常年没人校准。

我们习惯追问「模型有多聪明」,却很少追问「这个分数是谁打的,打分的程序自己及格了吗」。

往后看,我觉得有几件事值得做,而且都不难:

  • 发布分数时同步公布评分器审计结果:抽了多少题、人工复核比例、发现多少误判。没有这些上下文的分数,参考价值要打折。
  • LLM judge 的判分本身也要抽检,尤其是边界案例。judge 也是模型,也会犯错,也会幻觉。
  • 对任何「分数跳变」保持怀疑,无论方向。暴涨先查评分器,暴跌再怀疑模型。
  • 别拿单一基准下结论。六个基准里五个都有毛病的话,新闻稿里那个数字什么也说明不了。

物理审计的作者团队说得很直白:现有基准需要更难的、专家级的评测题。我补一句自己的判断——比更难的题更急迫的,是更可信的判分。题难了判分烂,只会造出更大的噪声。


评测是AI行业的度量衡。度量衡失准的时候,最先失真的不是模型排名,而是我们对自己走到了哪里的判断。47.3%到78.7%之间的距离,不是模型走过的路,是评分器欠下的账。