当AI评测学会「双盲」:一场迟到的考试改革

当AI评测学会「双盲」:一场迟到的考试改革

考试最大的问题,从来不是考生作弊,而是出题人、考生和阅卷人挤在同一间办公室。AI评测正在补上这一课。

当AI评测学会「双盲」:一场迟到的考试改革

一个让人不太舒服的事实

先说个我每次看发布会都会想起来的事。都2026年了,整个行业给大模型打分的方式,本质上还是”自己出题、自己考试、自己阅卷”。

模型在GPQASWE-bench这些基准上的分数一个比一个漂亮,柱状图一年比一年高。可只要你在真实工作里用过这些模型,就能感觉到分数和体验之间隔着一层什么。分数涨了30%,你干活时却尝不出30%的轻松。

问题出在哪?DeepMind最近给出了一个官方承认的答案:评测流程本身不可信。他们开始做世界上第一个双盲AI评估测试,把新药临床试验的那套规矩搬了过来。

基准测试是怎么被玩坏的

要理解双盲为什么重要,得先看看现在的评测是怎么运作的。

公开基准的题目是公开的。这意味着什么?意味着训练数据里大概率就有这些题。社区管这叫基准污染(benchmark contamination),业内早就不当秘密了。一个模型在测试集上刷出高分,你分不清它是真学会了推理,还是背过了答案。

就算题目没泄露,还有更隐蔽的一层。团队盯着榜单训练,对着失分点迭代。这个过程有个学名,叫Goodhart定律:当一个指标变成目标,它就不再是好指标。

结果就是榜单上的一片繁荣,繁荣到两个模型分数差2%已经说明不了任何问题。但发布会的PPT照样拿它当核心卖点。

说真的,我越来越觉得AI行业最大的泡沫不在算力,在评测。分数通胀比货币通胀狠多了,而且没人负责加息。

双盲到底是怎么做的

DeepMind这次的方案,拆开看就三步:

  1. 出题方和被测模型背后的团队互相不知道对方身份;
  2. 题目做匿名化处理,换掉容易被”认出来”的表述和领域特征;
  3. 评分环节同样隔离,阅卷方不知道自己评的是谁家的模型。

熟悉医学的人一眼就能认出来,这是临床试验里用了几十年的双盲设计。药物研发必须双盲,因为一旦医生知道病人吃的是新药,他的记录方式、甚至病人的心理暗示都会污染结果。评AI是同一个道理:知道被测的是谁,打分的手就会不自觉地松或者紧。

临床试验的规矩,正在被搬进AI评测

(双盲设计源自药物临床试验。图:Unsplash @Julia Koblitz)

双盲能修什么,修不了什么

我特意去翻了翻细节,有一个地方值得说清楚:双盲管得住”评分偏向”和”题目识破”,管不住所有问题。长周期任务的真实表现、多轮交互里的用户体验,这些都不是一次盲测能覆盖的。它是止血,不是换心脏。

修的是流程,还是信任?

把新旧评测方式摆在一起,差别就很直观了:

维度 传统榜单评测 双盲评估
题目保密 公开可查,大概率进了训练集 匿名化,动态更换
评分者 模型自家团队或公开判分 独立方,身份隔离
可否刷分 可以对着榜单针对性优化 难以提前准备
结果性质 营销素材 更接近可信证据

这里有个微妙的地方值得掰扯。有人会说,双盲评测是大厂自己发起的,既当运动员又当裁判的结构没变,只是给裁判戴了个眼罩。这个批评有道理。但”纯粹是公关动作”这种更极端的说法,我不太同意。

我的看法是:流程上的约束,哪怕由利益相关方发起,也强过没有约束。临床试验早期也是药厂赞助的,双盲规则照样把一堆无效药挡在了市场外面。规矩的价值不在于谁定的,在于能不能被独立验证。

双盲之外的真正难题

把话说透,双盲只是止痛片。

评测危机的根子在于:评测是公共品,但做评测的成本是私人掏的。谁出钱,谁就有动机让结果好看一点。这个结构不改,双盲、三盲、五盲都只是把猫捉老鼠的游戏换个场地。

往前看,我认为一套可信的评测至少得凑齐这几块拼图,虽然我也不确定行业愿不愿意凑:

  • 独立第三方长期运营,经费来自公共基金或行业共担,而不是单一厂商;
  • 题库像杀毒软件的病毒库一样动态更新,让”背题”彻底失效;
  • 留一部分永不公开的保留题集,定期抽测,公开方法论,哪怕不公开题目本身。

顺带说一个我自己的观察。写评测相关的内容多了,评论区最常见的反驳是”反正我自己用着好才算数”。这话对了一半。个人体验当然重要,但它没法横向比较:你说A好用,我说B好用,吵一万年也没有结论。评测存在的意义,恰恰是提供一个大家都能查证的公共标尺。标尺歪了,整个行业的信息流都是歪的。

评测屏幕上的每一个数字,都在替行业回答"谁更强"

(评测数据是行业共享的标尺。图:Unsplash @Stephen Dawson)


写在最后

双盲评测这件事,单看是一条产品新闻,放长了看,是行业在为自己此前的透支还债。

基准测试本来是给AI进步量体温的温度计。温度计失灵不可怕,可怕的是所有人都假装它还准。

DeepMind迈出了第一步,值得肯定,也仅此而已。真正的考试改革,要等评测的运营权、经费和题库跟厂商利益彻底切割的那天。在那之前,看到任何分数,我的建议都一样:先砍一半,再看。