数学的深蓝时刻:AI用不到2000美元解开了人类十年未解的难题

当AI用不到2000美元解决了一个人类顶尖数学家十年都无法攻克的难题,我们不再是在讨论工具的效率——我们在见证认知范式的转移。

数学深蓝时刻

一个”深蓝时刻”

2026年8月,OpenAI发布了一份震动学术界的报告:其内部代号Astra的模型,在纯数学和理论计算机科学领域一口气解决了十个至少十年没有进展的开放问题

每一个问题的token费用不到2000美元。

要知道,这些问题不是那种靠暴力搜索就能攻破的工程难题。它们是数学家们长期悬而未决的核心猜想——有的涉及代数几何的深层结构,有的触及计算复杂性的根本边界。对于这些问题,人类研究者已经尝试了各种方法,写了大量的论文,却始终无法突破最后的障碍。

数学界的反应是强烈的。很多人将其比作1997年IBM深蓝战胜国际象棋世界冠军卡斯帕罗夫的那一刻——一个象征性的分水岭。但这一次被撼动的不是棋盘上的王后,而是数学本身的边界。


十个问题的分量

要理解这个成就的重量,我们需要看看这些问题的性质:

  • 至少十年无进展:每个问题在提出后的十年间,都没有任何研究者取得实质性突破
  • 涵盖多个子领域:从代数几何到计算复杂性,从组合数学到数论,分布广泛
  • 结果已被形式化验证:所有证明均以Lean 4形式化语言重写,通过了机器验证

第三点尤为关键。在过去,即使AI生成了看似正确的证明,学术界最大的疑虑始终是:我们如何信任一个无法解释推理过程的黑箱?

OpenAI这次的做法直接回应了这个质疑——他们不仅给出了自然语言的证明,还在GitHub上开源了完整的Lean 4形式化证明,并附带论文和推理过程的重建文档。这意味着每一个步骤都可以被独立验证,每一个逻辑跳跃都必须通过形式化检查器。

这不是”我告诉你答案是对的”,而是”这是你可以自己验证的证明”。

形式化验证的引入,让这次数学突破从”可信的黑箱输出”变成了”可审计的严密论证”。这是AI辅助数学研究从工具到合作者的关键一步。


与传统数学研究的效率对比

让我们用一组数据来直观对比:

维度 传统数学研究 Astra模型
单个问题平均耗时 数月到数年 数小时到数天
单个问题成本 数万至数十万美元(人力+计算) < $2000(token费用)
验证方式 同行评审(数月) Lean 4形式化验证(即时)
覆盖广度 极度依赖研究者专长 可跨子领域并行探索
创新性来源 人类直觉与灵感 大规模模式识别与推理链

这个对比并不意味着AI将取代数学家。它揭示的是一个更深层的现象:AI在数学领域的优势不在于”更聪明”,而在于”更不受约束”

人类数学家在解决问题时,往往会被自己领域的思维范式所限制。一个代数几何学家在面对数论问题时,可能难以跳出自己的思维框架。而AI模型在训练中吸收了几乎所有数学分支的知识,它可以在不同领域之间自由”穿梭”,找到人类专家意想不到的联系。


2000美元背后的经济学

“每题不到2000美元”这个数字,可能是这份报告中最具颠覆性的信息。

想想看:在过去,一个数学问题的研究投入通常是多少?

  1. 人力成本:一个博士生或博士后的年薪在5-10万美元
  2. 时间成本:一个问题可能需要数年的专注研究
  3. 试错成本:大量的错误方向、失败的证明尝试
  4. 机会成本:研究者无法同时推进其他问题

而现在,2000美元的token费用就能启动对一个难题的全面探索。这不是在压缩研究的成本——这是在重新定义研究的经济学

对于发展中国家的高校、资源有限的研究小组、甚至独立研究者来说,这意味着什么?意味着他们第一次拥有了与顶级实验室竞争的算力工具。数学研究的民主化,正在以一种意想不到的方式发生。

但这也带来了新的问题:当研究成本如此之低,我们如何防止低质量的大规模生成淹没真正有价值的发现?当每个人都能用2000美元”生产”一个数学定理,同行评审体系如何应对?

2000美元解一道十年未决难题,这个数字本身就是一个宣言:知识生产的边际成本正在趋近于零。


“深蓝时刻”之后会发生什么?

1997年深蓝击败卡斯帕罗夫之后,国际象棋没有消亡——它反而进入了一个新纪元。棋手们开始与AI合作训练,人类+AI的组合远超任何单独的棋手。国际象棋的理论库被极大地扩展,新的开局变体、新的战术组合被发现,整个领域焕发了前所未有的活力。

数学很可能走一条类似的道路,但有两个关键区别:

  1. 数学的问题空间是无限的。国际象棋的局面总数虽然巨大,但终归是有限的。而数学中未解决的问题数量可能是无穷的。AI在数学领域的”红利期”可能会比国际象棋长得多。

  2. 数学的社会结构更复杂。国际象棋的评判标准是胜负,简洁明了。而数学的评判涉及审美、直觉、深刻性——这些是更难量化的维度。一个”正确但不优美”的证明和一个”优美且深刻”的证明,在数学家心中的地位是截然不同的。

这也是GPT-5.6 Sol在同一天被报道证伪了Maxwell猜想的背景。AI不仅能在已有框架内解决问题,还在挑战和推翻人类长期持有的数学直觉。当AI开始告诉我们”你信了十年的猜想其实是错的”,数学研究的权力结构将发生根本性的变化。


Anthropic的加密发现:硬币的另一面

在同一天的新闻中,Anthropic发布了一项令人不安的平行研究:Claude能够发现密码学中的真实弱点,整个研究花费了约10万美元的token费用。

这项研究与OpenAI的数学突破是硬币的两面:

  • 正面:AI可以发现数学和理论计算机科学中的深层真理,推动人类知识的边界
  • 反面:AI可以发现加密协议中的真实漏洞,威胁数字基础设施的安全

Anthropic特别强调了他们寻找的是”真正的困难发现”,而非简单的已知漏洞复现。这意味着AI的安全评估能力已经达到了可以挑战现代密码学基石的水平。

当同一个技术既能推进数学前沿,又能威胁网络安全,我们面对的不是技术问题,而是一个文明级别的治理挑战。

这也是为什么Anthropic在同一天还发布了关于”双用途知识关闭开关”的研究——试图在AI模型中为危险知识设置可控的访问限制。但正如我们之前讨论过的,长篇政策文档在约束AI Agent行为方面效果有限。知识与安全的矛盾,正在成为AI时代最核心的张力之一。


对数学教育和研究的深远影响

这次突破对数学领域的影响将是多层次的:

对研究者而言

  • 研究范式的转变:从”独自苦思”到”与AI协同探索”将成为常态
  • 形式化证明的普及Lean 4等工具的使用将从少数专家扩展到更广泛的研究群体
  • 跨领域合作的加速:AI作为跨领域的桥梁,将促进不同数学子领域之间的融合

对教育而言

  • 技能重定义:数学教育的重点将从”计算能力”转向”问题定义能力”和”AI协作能力”
  • 评估体系变革:传统的解题考试将被更加开放、更具创造性的评估方式取代
  • 研究民主化:资源不再是进入前沿数学研究的壁垒

对整个科学共同体而言

  • 验证范式的改变:同行评审将与机器验证并行,提高学术出版的可靠性
  • 发现速度的加速:从理论突破到形式化验证的周期将从数年缩短到数天
  • 知识结构的重构:AI可能会发现人类数学分类体系中不存在的新的”自然结构”

我的观点:不是终点,而是起跑线

回顾整个事件,我认为最重要的不是”AI解决了十个数学问题”,而是这件事所揭示的三个趋势:

  1. 认知杠杆的指数增长:2000美元撬动十年未决难题,这意味着人类智慧与AI算力的结合正在产生前所未有的认知杠杆。我们正在进入一个知识生产呈指数增长的时代。

  2. 验证比发现更重要:OpenAI选择用Lean 4形式化所有证明,这个决策的明智程度怎么强调都不为过。在一个AI可以生成大量”看似正确”内容的时代,可验证性比正确性更稀缺

  3. 安全的紧迫性在加速:Anthropic的同日发布不是巧合——当我们赋予AI越来越强的数学和逻辑推理能力,它发现系统漏洞的能力也在同步增长。每推进一步数学前沿,我们就同时推进了AI的能力边界

数学的”深蓝时刻”已经到来。但这不是故事的结局,而是一个全新篇章的开篇。在这个篇章中,人类和AI将共同探索一个比我们现有认知更广阔的数学宇宙。

唯一的问题是:我们已经准备好迎接它了吗?


要点回顾

  • OpenAI的Astra模型解决了十个至少十年未解的数学问题,单题成本< $2000
  • 所有证明均以Lean 4形式化验证并开源,回应了可审计性的核心质疑
  • AI的跨领域推理能力是其核心优势,不受人类研究者的思维范式限制
  • GPT-5.6 Sol同日证伪Maxwell猜想,AI开始挑战人类数学直觉
  • Anthropic的加密发现研究揭示了同一技术的双刃剑本质
  • 形式化证明的普及、研究民主化、验证范式变革将成为数学领域的新常态