AI推理链加密的脆弱幻象:三大厂商集体翻车,暴露了什么
当Anthropic、OpenAI、Google三家公司同时宣布”已修复”的时候,比漏洞本身更值得琢磨的是——加密推理链这个概念,从一开始就不应该让普通用户产生安全感。

一条论文,干翻三家
8月初,arXiv上一篇论文(编号2608.09867)在安全圈引起了不少讨论。研究者披露了一个影响范围相当大的漏洞:Anthropic、OpenAI和Google三家厂商返回的”加密推理链”(encrypted chain-of-thought),其实可以被跨会话、跨用户、跨模型地复用。
具体怎么做的?研究者注入一个弱模型(能力较低的模型),对它进行越狱操作,然后用这个弱模型作为跳板,去恢复强模型(比如Claude Opus或GPT-5级别)的明文推理内容。论文里写得很清楚——他们从公开的6708条agent轨迹中,解码出了315320个推理块,其中包含了367条个人身份信息(PII)和182个凭证。

这个数字让我倒吸一口凉气。不是因为它大,而是因为这些推理链本该是”加密”的。
加密推理链到底是什么
先说清楚这个概念。所谓”加密推理链”,是各大AI公司在推出高级推理模型时引入的一个机制。模型在回答复杂问题之前,会先在内部进行多步推理(比如”思考”为什么某个数学题应该用特定方法解答),这些推理过程被加密后返回给用户。理论上,你只能看到最终的答案,看不到模型是怎么想出来的。
厂商推这个功能有几个目的:保护模型内部推理不被竞争对手学习,防止越狱攻击利用推理过程,还有就是商业壁垒,付费才能看到”思考过程”。
听起来合理,但问题在于,这个”加密”的强度远没有用户想象中那么可靠。
漏洞的技术细节:为什么加密会失效
论文披露的攻击方法并不算特别复杂,但设计得很巧妙。核心思路是:
- 推理链可以跨模型复用。当你用Claude做一道数学题,它的推理链被加密后存储。换一个更弱的模型(或经过越狱的模型)去请求同一个任务,系统可能返回同样的加密推理链,而此时面对的是一个更容易攻破的模型。
- 弱模型更容易被越狱。攻击者可以诱导弱模型直接吐出推理内容,或通过精心设计的prompt绕过安全限制。
- 推理链在不同模型之间存在关联性。从弱模型中恢复出部分推理内容后,这些信息就能被用来推断强模型的完整推理逻辑。
整个过程不需要破解任何加密算法本身。打个比方,这更像是骗开锁的人,而不是硬撬那把锁。
这里有个表格,比较一下加密推理链的”设计目标”和”实际效果”:
| 设计目标 | 实际效果 |
|---|---|
| 保护推理内容不被泄露 | 通过弱模型跳板可恢复明文 |
| 防止竞争对手学习推理策略 | 跨模型复用直接暴露推理逻辑 |
| 增加越狱难度 | 越狱反而成了攻击链的起点 |
| 保护用户隐私(PII) | 367条PII从”加密”数据中泄露 |
| 商业壁垒(付费解锁思考) | 加密形同虚设 |
暴露出的三个深层问题
这个漏洞暴露出来的东西,比一个技术bug严重得多。
安全-by-design 在AI行业仍然是空话。
三家公司几乎同时在推理链中采用了类似的加密方案,而且这个方案存在同样的弱点。这说明什么?要么是大家抄了同一种思路,要么是安全审计形同虚设。无论是哪种情况,都让人对”负责任的AI部署”这个说法打上问号。
我注意到OpenAI在8月11日刚刚发布了一封”负责任的AI基础设施”公开信。时间点很微妙——漏洞论文发布在前,公开信在后。也许这两件事没有直接关系,但”说一套做一套”的观感确实很难避免。
加密推理链本身就该被质疑。
从用户的角度看,加密推理链把模型的”思考过程”藏了起来。你说这保护了商业机密,那用户凭什么信任一个看不到思考过程的黑箱来做关键决策?你说这保护了隐私,但这次泄露恰恰证明加密本身并不可靠。
说真的,我觉得加密推理链更像是厂商摆出的姿态,”我们在保护模型安全”,至于到底解决了什么实际问题,另说。如果推理链真的需要加密,那它就不应该在任何情况下被跨模型共享。
Agent生态的安全焦虑正在加剧。
这次漏洞的数据量特别值得注意:6708条agent轨迹。Agent不同于普通的对话模型,它会在多轮交互中执行操作、调用工具、生成代码。如果agent的推理链可以被解密,意味着攻击者不仅知道模型”想”了什么,还可能推断出它在用户的系统里”做”了什么。
Docker刚刚推出了AI Agent专用的隔离沙箱产品(8月发布),恰好印证了这个趋势——业界已经意识到Agent的安全问题比传统对话模型严重得多。但沙箱解决的是执行层面的隔离,推理链泄露则是认知层面的暴露。两道防线都需要加强。
同日其他安全事件:不是孤例
有趣的是,同一天的安全新闻远不止这一条:
- 人类审批AI Agent命令时漏掉1/3威胁。在一项40000场游戏试验的研究中,人类审批者遗漏了大约三分之一的Agent危险操作。这直接说明了一个问题——当Agent变得足够复杂、操作足够多的时候,人根本看不过来。
- 18万条AI会议录音泄露。笔记应用中超过181000条AI会议录音被发现公开暴露。
- 伦敦地铁开始扫描乘客面部。实时面部识别试点已进入地铁系统。
这些事放在一起,指向一个共同的主题:AI系统的部署速度远远跑在了安全设计的前面。推理链加密做了一半,Agent审批靠人眼,会议录音随意存储,面部识别直接上马。单拎出来每一项都能自圆其说,拼在一起就挺让人不安的。

各厂商的修复:治标还是治本?
论文披露后,三家公司都确认了漏洞并发布了修复。Anthropic、OpenAI和Google分别更新了推理链的加密和隔离机制。
但修复方案的具体内容,目前没有公开细节。这又回到了前面的问题:如果加密推理链的基本设计思路不改变——比如跨模型复用的架构不变——那修复的只是在当前攻击路径上打补丁。下一个研究者可能换一种完全不同的方式绕过去。
历史上这类案例比比皆是。DRM(数字版权管理)被破解了无数次,每次都是打补丁,然后被再次破解。加密推理链在本质上和DRM面临同样的困局:你需要在把内容交给用户的同时阻止用户看到内容。这个矛盾在信息论层面根本不成立。你把加密数据给了用户,用户就有可能想办法解密。
我的看法
说到底,加密推理链这件事让我重新思考一个问题:我们到底在保护什么?
如果是保护模型推理能力不被竞争对手抄袭,那应该用更强壮的加密方案,从架构层面切断跨模型复用的可能。如果是保护用户隐私,那根本不该存储包含PII的推理内容。如果是防止越狱,那加密推理链本身就不是正确的方向,应该加固模型的指令遵从能力,而不是把思考过程藏起来当鸵鸟。
现状是,这三个目标都只实现了一半,然后被一次攻击全部击穿。
这次漏洞是个警钟。但这钟已经响了多少次了?OpenAI伦理负责人入职不到一年就离职,SAP因为AI成本失控冻结了全公司招聘和差旅,Kinney药店的AI电话助手被数百起投诉逼退。安全研究者在努力推进,但商业压力总是把安全排到后面。
也许我们得接受一个不太舒服的事实:在Agent大规模部署的现阶段,安全是一个需要持续投入、不断迭代、大概率永远无法”彻底解决”的工程活儿。
与其花力气说服用户”我们很安全”,不如坦白告诉他们风险在哪、边界在哪、出了事能怎么补救。
透明的风险沟通,比包装精美的安全感,靠谱得多。