ARC Prize与AGI的黎明:当开源模型开始触碰抽象推理的天花板

ARC Prize与AGI的黎明:当开源模型开始触碰抽象推理的天花板

当一个开源模型在”AGI圣杯”测试中杀出重围,比它得了多少分更值得关注的问题是:我们用来衡量智能的标尺,是不是正在失效?

ARC Prize与AGI的黎明:当开源模型开始触碰抽象推理的天花板

8月初,ARC Prize的排行榜上出现了一个让社区议论纷纷的结果:DeepSeek V4 Flash 0731在抽象推理基准测试中取得了亮眼成绩。在Hacker News上,这个话题获得了762个赞和454条讨论——对于一个技术评测结果来说,这个热度不寻常。

为什么一条评测成绩能引发这么大的反应?因为ARC Prize不是普通的benchmark。Chollet在2019年设计它的时候,出发点很明确:测”流体智能”(fluid intelligence)。模型没法靠见过类似的题来蒙混过关,必须面对完全陌生的任务范式,当场想明白规律是什么。一个开源模型在这类测试上出彩,传递的信息很简单:通往通用智能的路上,闭源并不垄断入场券。

但热闹背后还有个更烦人的问题。ICML 2026上有一篇论文,系统性地统计了60个语言模型基准测试的饱和状态,数字让人不太舒服:近半数基准已经饱和了。分数越来越高,但模型到底是不是真的变”聪明”了,谁也说不清。

把这两件事放在一起看,挺有意思的。


ARC Prize:为什么它不一样?

先说清楚ARC Prize到底是什么。

大多数AI基准测试有个老毛病:数据集一公开,模型通过训练数据就有机会间接”看到”测试题。再怎么小心划分训练集和测试集,在互联网时代几乎防不住。MMLU、HumanEval、GSM8K,这些你肯定听过名字的测试,全有这个问题。

ARC(Abstraction and Reasoning Corpus)的思路不一样。它给模型几个输入输出的例子,让模型推断规律,然后去解决一个全新的类似问题。关键在于,这些规律在训练数据里根本没出现过,没捷径可走。

抽象推理

Chollet把它比作瑞文推理测验,考的不是知识储备,而是你能不能当场把规律想明白。大语言模型擅长模仿和模式匹配,但面对完全陌生的任务范式,表现一直不算好。

所以当DeepSeek V4 Flash在ARC上取得突破时,大家兴奋的不是分数本身,而是这件事背后的含义:抽象推理这块硬骨头,可能真的被啃下来了。

DeepSeek做了什么特别的事吗?从公开信息看,V4 Flash延续了他们一贯的路子:高效的架构设计,扎实的训练流程,加上开源社区的反馈迭代。没有什么花哨的噱头,就是硬把模型变聪明。这种闷声干大事的风格,确实是DeepSeek的招牌。


基准测试的”饱和陷阱”

不过,正当大家为ARC上的进展高兴的时候,ICML 2026上那篇论文的数据让人冷静了不少。

斯坦福等机构的联合研究分析了60个主流语言模型基准测试的饱和状态,结论有点扎心:

基准测试类型 饱和率 趋势
公开数据集基准 ~50% 持续增长
专家策划基准 <20% 相对稳定
推理类基准 ~35% 加速饱和
代码类基准 ~60% 接近上限

“饱和”是什么意思?就是顶部的模型分数已经接近理论最大值了。GPT-5、Claude Opus、Gemini Ultra在某个基准上都拿了95分以上的时候,98分和95分之间的差距到底代表什么?大概率只是一些针对性的优化,而不是真正的”更聪明”。

论文里有个挺关键的发现:专家手工策划的基准测试更能扛住饱和。ARC Prize到现在还没饱和,原因就在这,每次测试的题目都是人工新出的抽象推理任务,模型没地方”刷题”。

这引出了一个挺尖锐的问题:当我们看到某个模型在benchmark上得了高分,这个分数到底在测什么?

是模型在变聪明,还是我们在变相降低考试的难度?


两个故事的交汇

把DeepSeek在ARC上的成绩和基准饱和研究放在一起看,会得到一个更有意思的结论。

首先,ARC Prize还没饱和这件事本身就说明了它的价值。行业里遍地都是满分测试,能还分得清谁强谁弱的测试反而稀缺。Chollet在2019年的设计直觉扛住了这几年的考验:流体智能测试确实比知识测试更能暴露AI的真实水平。

其次,一个开源模型在ARC上取得突破,信号比分数重要。过去两年行业里的主流叙事是”训练前沿模型只有巨头才玩得起”。DeepSeek直接用结果打了脸:高效的架构和训练方法可以大幅缩小差距。代码能力上已经让闭源对手不舒服了,现在推理能力也在追。

  1. 效率路线确实行得通。DeepSeek不靠堆算力,靠模型设计上的巧劲
  2. 开源模型的”便宜但落后”标签该撕了
  3. 抽象推理能力的提升,比堆知识储备更有长远价值
  4. 饱和危机逼着行业重新定义”什么是智能”

饱和之后:我们该测什么?

如果说近半数基准已经饱和,那接下来的路怎么走?

这篇ICML论文给出了几个方向性的建议,我觉得值得展开聊:

方向一,对抗数据泄露,做动态基准。ARC Prize就是这种路子,每次测试生成全新任务,模型没法提前准备。这个思路可以扩展:数学推理可以不断出新题型,代码能力可以用没见过的API组合来测试。

方向二,从”能不能做”转向”做得好不好”。模型在标准测试上快拿满分了,评估焦点得换:推理过程的可解释性怎么样?出错了能不能自己纠正?条件模糊的时候判断靠不靠谱?能解出正确答案但讲不清为什么的模型,和既能解题又能讲明白的模型,显然不在一个层次。

方向三,把人类对齐纳入评估。AI的”智能”最终得在真实场景里体现。benchmark拿满分但用起来让人头疼的模型,和分数略低但干活利索的模型,后者价值大得多。Scalex在4万次游戏中收集到的一组数据让我印象很深:人类审查AI操作时的威胁检出率只有66.3%。三分之一的威胁就这么被漏掉了,”审批疲劳”不是段子。

AI评估

说白了吧,我们正处在一个评估体系青黄不接的阶段。旧的在失效,新的还没建起来。ARC Prize这类测试在这个空档期里格外重要,因为它们的分数还多少能说明点问题。


DeepSeek的开源信号意味着什么

回到DeepSeek在ARC Prize上的表现。分数先放一边,几个信号值得关注:

  • 开源模型在推理能力上追得很快。这不是”开源也不差”的客套话,DeepSeek在代码、推理、数学几个赛道都在缩小差距
  • 效率路线的潜力被严重低估。行业叙事一直说”算力为王”,但DeepSeek用更少的资源干出了接近的效果。这直接挑战了整个行业的资源配置逻辑:十分之一的成本做到九成的效果,你还要不要砸十倍的钱?
  • 中国AI的竞争格局在变。DeepSeek不是靠政策或资本催熟的,是靠技术路线硬赢了社区尊重。这条路比什么PR宣传都好使

一点个人看法

说真的,我现在最大的困惑不是模型够不够聪明,而是我们根本搞不清它们到底有多聪明。

基准饱和这事挺要命的。你习惯了用分数来衡量进步,忽然分数变得不可靠了,整个决策链条都跟着晃。投资人不知道该投谁,开发者不知道该选什么模型,研究人员也不知道该往哪使劲。这种集体失焦的状态,比任何一个单一的技术瓶颈都让人焦虑。

DeepSeek在ARC上的成绩,我觉得最大的意义就是它提供了一个还没被饱和的测试维度。在遍地满分的benchmark里,还能拉开差距的标尺特别稀缺。

至于AGI什么时候来?我觉得这个问题本身可能就问偏了。与其纠结”什么时候到达AGI”,不如一个个去看:现有的AI在哪些具体任务上还不够好?后者是工程问题,能一步步推进。前者更像个哲学问题,答案取决于你给”通用”下什么定义。

我能确定的是一件事:开源模型开始碰到抽象推理的天花板了,这比几个月前大多数人预想的要快。


我们不需要一个全能的AI,我们需要的是一个在面对没见过的难题时,能当场想明白的AI。ARC Prize至少说明了一件事:这条路有人在走,而且走得比预期的快。