AI的聪明可能是个误会:工作记忆碾压人类,才是真正的秘密
把AI的”智能”拆开来看,你会得到一个不太舒服的结论:它最厉害的也许不是推理能力,而是能同时记住多少东西。

最近有篇文章在 Hacker News 上拿到了 403 个赞,讨论相当热烈。核心观点很简单:AI的”智能”,很大程度上来自远超人类的工作记忆容量,而不是我们以为的那种”推理能力”。
乍一听像在泼冷水。但仔细想想,这个角度可能比大多数AI能力分析都更接近真相。
人类的大脑,到底有多”小”
先说个冷数据。心理学研究早就确认了,人类工作记忆容量大约是 4±1 个信息块(chunk)。什么概念呢?就是你在心算两位数乘法的时候,脑子里能同时转的东西非常有限。超过这个数,信息就开始互相覆盖、丢失,或者你不得不反复在记忆里翻来翻去。
这不是智力问题,是硬件限制。你可以在数学竞赛里练出惊人的心算速度,但你没法同时把12个变量之间的关系全部悬浮在意识里。
而现在的LLM呢?上下文窗口能塞进去的信息量,以 token 算动辄几十万、上百万。我知道”注意力”机制和人脑的工作记忆不能简单类比,但效果摆在那儿:模型确实能在一次推理中处理远超人类认知极限的信息量。
举个例子。你让 GPT-5.6 同时分析一份100页的财务报表、三份行业研究和一段用户访谈,然后做交叉分析。它不会”忘了”报表第67页写了什么,不会在处理访谈时把研究结论弄丢。人类分析师做同样的活,需要在文档间反复跳转、做笔记、画思维导图。说白了,这些外部工具就是在给工作记忆打补丁。

电路板与大脑的交汇——AI能力的本质究竟是什么?
数学领域是最明显的证据
原文章在数学领域的分析特别有说服力。我自己的感受是:
一个普通人做不了高维数学题,很多时候不是因为他”不够聪明”,而是因为他记不住中间步骤。你要证明一个定理,推导链条有20步,每一步都依赖前面3-4个中间结论。对人类来说,这几乎不可能徒手完成。不是不懂逻辑,是工作记忆根本装不下这条链条。
但AI可以。它不会在推导到第15步的时候”忘记”第3步的关键假设。
我不是说AI没有推理能力,推理当然存在。但问题是,当我们夸AI”比人类聪明”的时候,到底有多少是真正的推理优势,多少其实是记忆容量的碾压?
我自己瞎猜,比例大概是 30% 推理,70% 记忆。当然这个数字不一定准确,但方向应该没跑偏。
“涌现”可能只是记忆溢出
顺着这个思路往下想,一个更有意思的问题冒出来了:大模型那种被吹上天的”涌现能力”(emergence),有多少其实是记忆容量突破阈值之后自然出现的副产品?
过去几年大家都在讨论参数规模和涌现的关系。模型到了一定规模,突然”会”做数学题了、”会”写代码了。这种”突然会了”的表象背后,可能藏着一个更朴素的解释:
当一个系统的记忆容量大到一定程度时,很多以前做不到的推理任务自动变得可行了。
想象一个极端情况:如果人类的工作记忆是100个信息块而不是4个,我们会觉得很多现在需要”外部工具”才能完成的任务变得”自然而然”。但你的推理方式本质上没有变化,你只是能记住更多东西了。
这跟另一个观察也能对上:大模型在需要同时处理大量信息的任务上表现特别好,但在需要”顿悟”或者”跳出框架”的任务上,优势就没那么明显了。如果说这符合”记忆优势大于推理优势”的判断,我觉得八九不离十。

认知科学与AI的交汇——我们如何定义「智能」?
这对AI发展意味着什么
如果这个判断大体正确,那几个重要的推论就浮现出来了:
-
扩大上下文窗口可能比提升推理能力更有性价比。 如果AI的”聪明”主要来自记忆容量,那把窗口从128K扩到1M的收益,可能比在推理架构上搞各种花哨改进更直接。
-
AGI可能比我们以为的更近,但也更”蠢”。 如果核心瓶颈是记忆容量而不是推理深度,那现在扩大上下文+轻度推理优化的路线,可能方向没错。但这也意味着AGI本质上是一个”记忆力超群的系统”,跟”理解力超越人类”是两码事。
-
人机协作模式得重新想。 既然AI的优势是记忆而不是推理,那它该做的事是”替人记住”而不是”替人思考”。最佳模式大概是:人类提供判断和方向,AI负责承载和检索所有需要同时处理的信息。
把AI当成一个不会忘记任何事情的助手,而不是比你更懂思考的专家。你会发现它的能力被更好地用起来了。
一个让人不太舒服的平行
让我再说一个更有意思的角度。
不知道你有没有注意到,很多AI能力讨论都有一个隐含假设:AI的”智能”是均匀分布的。推理、记忆、创造力、语言理解,这些维度大致同步提升。但现实可能完全不是这么回事。
AI可能在某些维度上已经远超人类,比如信息存储、快速检索、模式匹配。但在因果推断、创造性类比、常识判断这些维度上,它仍然明显不如人类。我们看到的”AI表现”,其实是一个极度不均匀的能力组合的综合结果。
打个不太恰当的比方:超级计算机做加法比人类快一亿倍,这不代表它更”懂数学”。它只是在某种特定操作上更快而已。当我们把”快速检索+大容量记忆+模式匹配”的组合效果叫做”智能”的时候,也许我们犯了一个范畴错误。
| 维度 | 人类水平 | 当前AI水平 | 差距方向 |
|---|---|---|---|
| 工作记忆容量 | 4±1 信息块 | 10万+ tokens | AI碾压 |
| 长程信息保持 | 需外部存储 | 上下文窗口内无损 | AI碾压 |
| 快速模式匹配 | 中等 | 极强 | AI碾压 |
| 因果推断能力 | 强(直觉+经验) | 弱(统计关联为主) | 人类领先 |
| 创造性类比 | 强 | 中等(更多重组) | 人类领先 |
| 常识判断 | 强 | 弱(幻觉问题) | 人类领先 |
| 道德直觉 | 复杂 | 缺失 | 人类独有 |
这张表肯定不够精确,但方向感应该没问题。AI不是那种在所有维度上都更强的”超人”,更像是在某些维度上异常强大、其他维度上依然笨拙的异类。
接下来值得关注的几个信号
如果你觉得”记忆是AI的主要优势”这个判断有点道理,那下面几个发展值得留意:
- OpenAI的GPT-5.6 Sol Ultrafast模式 推理速度提升14倍,说明业界在推理能力上加码了。但这是否解决了记忆和推理之间的失衡?我个人持观望态度。
- Google HEIR同态加密编译器 让模型在加密数据上做推理。如果记忆优势在加密场景下打了折扣,AI表现会怎样变化?这简直是一个天然实验。
- Anthropic的多智能体系统研究 试图用多个Agent协作,本质上是分布式记忆+推理的架构,可能是弥补单体模型推理弱点的路子。
- OmniScientist全模态AI科学家 36个案例全部生成完整论文,但如果细看,这些”研究”里有多少是真正的科学推理,多少是海量文献模式匹配后的高质量重组?
写在最后
“AI的智能主要来自工作记忆容量”这个判断,我不是在贬低AI,也不是否认进步。只是觉得,搞清楚AI真正的优势在哪里,比盲目惊叹或者盲目恐惧都有用得多。
当你下次看到AI又”通过”了某个高难度测试的时候,不妨先问一句:它到底是在”思考”,还是在”记住了一切”?
答案可能没那么重要。但能提出这个问题,说明我们至少开始从更实际的角度去理解AI了。
AI真正让人担心的,不是它比我们聪明,而是我们误以为它的聪明和我们的聪明是同一种东西。
参考来源:davidepiffer.com, Hacker News 讨论, arXiv相关论文