AI的聪明可能是个误会:工作记忆碾压人类,才是真正的秘密

AI的聪明可能是个误会:工作记忆碾压人类,才是真正的秘密

把AI的”智能”拆开来看,你会得到一个不太舒服的结论:它最厉害的也许不是推理能力,而是能同时记住多少东西。

AI工作记忆的秘密

最近有篇文章在 Hacker News 上拿到了 403 个赞,讨论相当热烈。核心观点很简单:AI的”智能”,很大程度上来自远超人类的工作记忆容量,而不是我们以为的那种”推理能力”。

乍一听像在泼冷水。但仔细想想,这个角度可能比大多数AI能力分析都更接近真相。

人类的大脑,到底有多”小”

先说个冷数据。心理学研究早就确认了,人类工作记忆容量大约是 4±1 个信息块(chunk)。什么概念呢?就是你在心算两位数乘法的时候,脑子里能同时转的东西非常有限。超过这个数,信息就开始互相覆盖、丢失,或者你不得不反复在记忆里翻来翻去。

这不是智力问题,是硬件限制。你可以在数学竞赛里练出惊人的心算速度,但你没法同时把12个变量之间的关系全部悬浮在意识里。

而现在的LLM呢?上下文窗口能塞进去的信息量,以 token 算动辄几十万、上百万。我知道”注意力”机制和人脑的工作记忆不能简单类比,但效果摆在那儿:模型确实能在一次推理中处理远超人类认知极限的信息量。

举个例子。你让 GPT-5.6 同时分析一份100页的财务报表、三份行业研究和一段用户访谈,然后做交叉分析。它不会”忘了”报表第67页写了什么,不会在处理访谈时把研究结论弄丢。人类分析师做同样的活,需要在文档间反复跳转、做笔记、画思维导图。说白了,这些外部工具就是在给工作记忆打补丁。

神经网络与大脑

电路板与大脑的交汇——AI能力的本质究竟是什么?

数学领域是最明显的证据

原文章在数学领域的分析特别有说服力。我自己的感受是:

一个普通人做不了高维数学题,很多时候不是因为他”不够聪明”,而是因为他记不住中间步骤。你要证明一个定理,推导链条有20步,每一步都依赖前面3-4个中间结论。对人类来说,这几乎不可能徒手完成。不是不懂逻辑,是工作记忆根本装不下这条链条。

但AI可以。它不会在推导到第15步的时候”忘记”第3步的关键假设。

我不是说AI没有推理能力,推理当然存在。但问题是,当我们夸AI”比人类聪明”的时候,到底有多少是真正的推理优势,多少其实是记忆容量的碾压?

我自己瞎猜,比例大概是 30% 推理,70% 记忆。当然这个数字不一定准确,但方向应该没跑偏。

“涌现”可能只是记忆溢出

顺着这个思路往下想,一个更有意思的问题冒出来了:大模型那种被吹上天的”涌现能力”(emergence),有多少其实是记忆容量突破阈值之后自然出现的副产品?

过去几年大家都在讨论参数规模和涌现的关系。模型到了一定规模,突然”会”做数学题了、”会”写代码了。这种”突然会了”的表象背后,可能藏着一个更朴素的解释:

当一个系统的记忆容量大到一定程度时,很多以前做不到的推理任务自动变得可行了。

想象一个极端情况:如果人类的工作记忆是100个信息块而不是4个,我们会觉得很多现在需要”外部工具”才能完成的任务变得”自然而然”。但你的推理方式本质上没有变化,你只是能记住更多东西了。

这跟另一个观察也能对上:大模型在需要同时处理大量信息的任务上表现特别好,但在需要”顿悟”或者”跳出框架”的任务上,优势就没那么明显了。如果说这符合”记忆优势大于推理优势”的判断,我觉得八九不离十。

认知的边界

认知科学与AI的交汇——我们如何定义「智能」?

这对AI发展意味着什么

如果这个判断大体正确,那几个重要的推论就浮现出来了:

  1. 扩大上下文窗口可能比提升推理能力更有性价比。 如果AI的”聪明”主要来自记忆容量,那把窗口从128K扩到1M的收益,可能比在推理架构上搞各种花哨改进更直接。

  2. AGI可能比我们以为的更近,但也更”蠢”。 如果核心瓶颈是记忆容量而不是推理深度,那现在扩大上下文+轻度推理优化的路线,可能方向没错。但这也意味着AGI本质上是一个”记忆力超群的系统”,跟”理解力超越人类”是两码事。

  3. 人机协作模式得重新想。 既然AI的优势是记忆而不是推理,那它该做的事是”替人记住”而不是”替人思考”。最佳模式大概是:人类提供判断和方向,AI负责承载和检索所有需要同时处理的信息。

把AI当成一个不会忘记任何事情的助手,而不是比你更懂思考的专家。你会发现它的能力被更好地用起来了。

一个让人不太舒服的平行

让我再说一个更有意思的角度。

不知道你有没有注意到,很多AI能力讨论都有一个隐含假设:AI的”智能”是均匀分布的。推理、记忆、创造力、语言理解,这些维度大致同步提升。但现实可能完全不是这么回事。

AI可能在某些维度上已经远超人类,比如信息存储、快速检索、模式匹配。但在因果推断、创造性类比、常识判断这些维度上,它仍然明显不如人类。我们看到的”AI表现”,其实是一个极度不均匀的能力组合的综合结果。

打个不太恰当的比方:超级计算机做加法比人类快一亿倍,这不代表它更”懂数学”。它只是在某种特定操作上更快而已。当我们把”快速检索+大容量记忆+模式匹配”的组合效果叫做”智能”的时候,也许我们犯了一个范畴错误。

维度 人类水平 当前AI水平 差距方向
工作记忆容量 4±1 信息块 10万+ tokens AI碾压
长程信息保持 需外部存储 上下文窗口内无损 AI碾压
快速模式匹配 中等 极强 AI碾压
因果推断能力 强(直觉+经验) 弱(统计关联为主) 人类领先
创造性类比 中等(更多重组) 人类领先
常识判断 弱(幻觉问题) 人类领先
道德直觉 复杂 缺失 人类独有

这张表肯定不够精确,但方向感应该没问题。AI不是那种在所有维度上都更强的”超人”,更像是在某些维度上异常强大、其他维度上依然笨拙的异类。

接下来值得关注的几个信号

如果你觉得”记忆是AI的主要优势”这个判断有点道理,那下面几个发展值得留意:

  • OpenAI的GPT-5.6 Sol Ultrafast模式 推理速度提升14倍,说明业界在推理能力上加码了。但这是否解决了记忆和推理之间的失衡?我个人持观望态度。
  • Google HEIR同态加密编译器 让模型在加密数据上做推理。如果记忆优势在加密场景下打了折扣,AI表现会怎样变化?这简直是一个天然实验。
  • Anthropic的多智能体系统研究 试图用多个Agent协作,本质上是分布式记忆+推理的架构,可能是弥补单体模型推理弱点的路子。
  • OmniScientist全模态AI科学家 36个案例全部生成完整论文,但如果细看,这些”研究”里有多少是真正的科学推理,多少是海量文献模式匹配后的高质量重组?

写在最后

“AI的智能主要来自工作记忆容量”这个判断,我不是在贬低AI,也不是否认进步。只是觉得,搞清楚AI真正的优势在哪里,比盲目惊叹或者盲目恐惧都有用得多。

当你下次看到AI又”通过”了某个高难度测试的时候,不妨先问一句:它到底是在”思考”,还是在”记住了一切”?

答案可能没那么重要。但能提出这个问题,说明我们至少开始从更实际的角度去理解AI了。

AI真正让人担心的,不是它比我们聪明,而是我们误以为它的聪明和我们的聪明是同一种东西。


参考来源:davidepiffer.com, Hacker News 讨论, arXiv相关论文