AI正在故意变笨:用世界知识换推理能力,这笔买卖划算吗
当一个模型AIME考了99.2分,却回答不出”法国首都是哪里”,你不应该觉得它蠢,而应该意识到:它从来没打算记住这件事。

一个反直觉的趋势
最近Hacker News上有一篇文章拿到了255个赞,标题直接说”模型正在故意变笨”。文章引用了一组对比数据,我盯着看了好一会儿,越看越觉得不对劲。
GLM-5.2,400亿活跃参数,AIME 2026数学竞赛测试拿了99.2%。同一个时期,SimpleQA知识回忆测试上,最强的Gemini 2.5 Pro只有53%。GLM-5.2呢?直接垫底。
数学推理的天花板被反复击穿,基础常识却在集体失忆。整个行业都在做同一件事:用世界知识换推理能力。

📷 Photo by David Matos on Unsplash
知识会过期,推理不会
要理解这个选择,得先想明白一个问题:世界知识对AI来说到底值多少钱?
答案是:越来越不值钱。
事实会变。2024年训练好的模型,到2026年,它的政治知识和流行文化梗已经过时了。你问它”现任法国总统是谁”,它大概率说马克龙,这在大多数时候没错,但你没法保证每一个事实都还新鲜。更烦人的是,事实性错误比推理错误隐蔽得多。模型推理走了一步错棋,你可以复现、debug。一个悄无声息的过时事实呢?用户可能根本没察觉,直到根据它做了一个错误决策。
那篇HN文章说得很干脆:事实会过时,推理程序不会。一个学会了拆解问题的模型,就算什么都不记得,只要能调搜索引擎和数据库,照样能把活干完。反过来,一个背下所有百科词条但不会推理的模型,基本是个高级复读机。
所以”变笨”其实是种防御策略。不给模型塞那么多容易过时的信息,它产生幻觉的概率就低一些。
模型不再试图全知全能,只专注把逻辑理清楚,也许反而更靠谱。
三种不同的”变笨”
但”故意变笨”这四个字背后,不同模型的操作方式差别挺大的。
| 模型路线 | 代表模型 | 做了什么 | 丢了什么 |
|---|---|---|---|
| 推理优先 | GLM-5.2, o-series | 压缩知识容量,强化思维链 | 常识问答准确率 |
| 参数瘦身 | Needle 2 (14MB) | 极端压缩到45M参数 | 几乎所有通用能力 |
| 默认懒思考 | Qwen 3.8 27B | 默认配置过度思考 | 响应速度和简洁性 |
GLM-5.2走的是第一条路,也是那篇HN文章讨论的核心。训练和推理策略上做了取舍,把更多参数预算分给推理模块,知识存储空间被压缩了。数学竞赛满分没问题,SimpleQA这种测试一塌糊涂。
Needle 2就更极端了。14MB,4500万参数,树莓派5上每秒500 token,Pebble智能戒指已经用上了。它谈不上”选择遗忘”,它压根就没打算往脑子里装东西。给物联网设备当助手,能听懂指令、能做简单操作就够了,别的要求都是多余的。
Qwen 3.8 27B的情况有点滑稽。Simon Willison评测的时候发现,这模型会”过度思考”:扔给它一个简单问题,它先来一段冗长的推理,然后才出答案。27B参数本来适合笔记本本地跑,但这个默认配置直接把实用性拉低了。说真的,本地模型最大的卖点应该是快和准,不是帮你做哲学思考。
“检索替代记忆”的大赌注
上面这几条路线,最终都押在同一个假设上:未来的AI不需要记住所有东西,只需要知道怎么找到东西。
这个赌注有多大?最近有两个信号值得看。
Google发布了HEIR,一个开源的同态加密AI推理编译器。简单说就是模型可以在加密数据上直接推理,不用先解密。信用卡欺诈检测、网络入侵检测这类场景,不用暴露原始数据就能完成分析。这意味着隐私和安全不再是AI推理的硬伤。
另一个信号来自Dario Amodei。Anthropic的CEO最近在社交媒体上说了句话,大意是:AI行业的问题不是”技术风险警告太多”,而是”承诺兑现太少”。公众信任危机的根源,说白了就是AI公司还没拿出让人信服的东西。
这两件事其实指向同一个底层逻辑:当AI的知识能力不再靠”记忆”撑着,AI的价值就取决于它能解决什么具体问题。Amodei焦虑也不奇怪。模型如果越来越不会做”聊天式百科全书”了,用户凭什么继续掏钱订阅?

📷 Photo by Alex Knight on Unsplash
我的判断:方向没错,但有个坑容易被忽略
说了这么多,我自己的看法是什么?
方向是对的。让模型专注推理,事实检索交给外部工具,架构上更合理。人类自己就是这样运作的,你不会要求外科医生背下《药典》每一个条目,你会要求他遇到不确定的情况能快速查、准确判断。AI一个道理。
但阵痛期比我想的长。问题出在外部检索的质量和速度还没跟上。模型放弃内置知识之后,搜索引擎给的答案如果有偏差,模型又没有足够的”常识底线”来纠偏,就会出现一个尴尬局面:既不如以前博学,又做不到足够精准。两头不靠。
还有一个很容易被忽略的问题。
当模型越来越不会”自由闲聊”,普通人的体验会持续变差。你问它一个常识,它要么去搜索(慢),要么直接说不知道。而大多数普通用户对AI的期待就是”什么都知道一点”。这个期待跟”推理优先”的设计方向,根本上是拧着的。
所以我觉得Amodei那句话说得挺实在的。行业在拼命优化数学和编程能力,但普通用户感知到的反而是”这AI好像没以前好使了”。
从”全知”到”擅长思考”,可能是2026年AI行业最安静也最深远的转向。普通用户买不买账,这才是真正的悬念。
写在最后
回到那篇HN文章的标题,”模型正在故意变笨”。我觉得更准确的说法是:模型正在选择性地变笨。
它放弃了大多数人觉得AI”应该有”的能力,比如百科全书式的知识储备,换来的是深度推理和问题拆解。商业上这是冒险,技术上可能是正解。
但作为用户,我们得接受一个事实:未来的AI不是变笨了,是在变成一种跟我们预期不同的东西。它可能不再是那个什么都能聊的万事通,但在你真正需要深度分析的时候,它也许能给出前代模型给不了的东西。
当然,前提是你的问题刚好落在它还”记得”的范围内,或者落在它愿意去搜索的范围里。
这个转变接下来会怎样?我觉得几件事值得关注:
- AI产品的形态在变。从”聊天机器人”慢慢变成”带推理能力的搜索引擎”,交互方式得重新想。
- 小模型的机会真来了。Needle 2这种14MB的东西说明,不是所有场景都需要GPT级别的推理,”够用”有时候比”强大”重要。
- 知识检索会变成主战场。模型不内置知识了,外部知识源的质量就是天花板。搜索引擎、数据库、知识图谱公司,可能是AI时代最关键的底座。
延伸阅读
- Models Are Getting Dumber on Purpose — 原文
- Needle 2: 14MB AI Model — Cactus Compute
- Qwen 3.8 评测 — Simon Willison