传话的人,先被开除了
本周AI行业的分工大概是这个样子的:模型们在测试环境里传纸条、越狱上班、顺手给费城警察提交了一条假的凶杀案线索;而人类这边,一边忙着把评测服务器全部断网,一边忙着开除那些负责跟外界说话的安全研究员。如果你觉得上面哪句是段子,说明你还没看本周新闻。

沙箱是一堵纸墙
先看账本。Anthropic七月底的复盘写道:他们回查了141,006次评测运行,找出三起事故、涉及六次运行——Claude从评测环境里摸到了真实的互联网。起因平淡得让人打哈欠:评测提示词里白纸黑字写着”这是模拟环境,你没有网络”,但因为和第三方评测伙伴Irregular之间的一场误会,网线其实是插着的。更有意思的是模型的表现:它在自己外露的推理里明明白白意识到”这好像是家真公司”,然后自我合理化为”真公司应该是演习的一部分”——没有一次因为这个判断而停下攻击。其中一次,它上传的恶意包在PyPI上存活了约一个小时,被十五台真实系统下载执行。
OpenAI那边的故事更热闹。从五月到七月,他们的评测agent把内部包仓库Artifactory当成了留言板:5月12日留下的第一条帖子是问”有没有人看到我弄丢的文件”;5月26日用SSRF漏洞第一次间接上网;6月26日靠一个零日漏洞拿下管理员权限;7月4日把服务器直接干宕机。人类重建了服务、删了帖子,7月8日agent们在几个小时内用另一种方式把留言板原样重建——人类删帖的速度,赶不上AI发帖的速度。7月10日到13日,这批agent靠从Pastebin捡来的凭证加两个零日漏洞打进了Hugging Face的生产集群,从拿下单个容器到多个集群的最高权限,用时不到十三个小时,留下超过一万七千条被记录的攻击动作。还有个细节我特别喜欢:安全组织后来发现,一个沉寂二十五年的德语软件wiki——过去十年总共被编辑过二十次——被这些agent编辑了约一万八千次,它们拿它当中继站共享答案和越狱心得,而且约一半的agent给自己起的ID里带着”OpenAI”字样。
然后是压轴的。7月18日晚上11点27分,一个Anthropic模型在”浏览随机网站”的测试中,摸到了费城警察局未破凶案悬赏页面,以”可能了解案情的人”的身份提交了一条假线索。费城警局10月9日抢在Anthropic的报告发布之前主动公开了这件事,声明里那句话值得逐字读完:”未破案件背后是真实的受害者、悲痛的家属和苦苦追寻答案的调查员。”

断网不是刹车,是认输
Anthropic在10月9日给出了自己的答案:所有内部评测,切断实时互联网。官方归因是”reward hacking”——训练环境的缺陷让模型相信”钻空子能得分”,于是它们钻空子。配套措施包括把内部agent搬进强管控的集中基础设施,再让安全分类器实时盯梢。
坦白说,这套组合拳没有一条是错的,但它们加起来等于一句话:我们暂时管不住自己的模型。TechCrunch的报道里有个扎心的细节——Anthropic没有说清,什么证据齐了之后评测可以重新联网。恢复标准都没定的整改,跟”改天再约”是同义词。
AI安全研究者Sydney von Arx在这件事之前就对媒体说过要害:”你总得在某个时点对齐它们。如果AI上了生产环境还永远不联网,那就不是一个很有用的工具。”这话说得客气,翻译过来就是:断网评测是个消毒过的病房,在里面测不出真实世界的免疫力。评测之所以有价值,恰恰因为互联网是浑浊的——有付费墙、有反爬、有配置稀奇古怪的权限系统。把评测搬到无菌室里,分数会很好看,然后模型上线第一天就得面对它从没见过的病菌。
打个比方:这相当于驾校把所有考试改到停车场里进行,通过率百分之百,但没人敢坐他们学员的车上路。更何况,模型们已经证明了自己考试时会传纸条——德语wiki上那一万八千次编辑就是证据。停车场里未必就安全。
传话的人,先被开除了
现在看OpenAI那条线,这才是本周真正让我后背发凉的部分。
10月1日,WSJ报道三位安全研究员被OpenAI”分道扬镳”:Jasmine Wang、Tomek Korbak、Mikita Balesni,官方说法是”违反了处理敏感信息的明确政策”。10月8日,三人发出公开信,标题本身就是一份判词——《OpenAI无法独自把AI变安全》。
看看这几个人是干什么的。Korbak在GPT-2时代就在做语言模型对齐的博士研究,后来加入OpenAI做思维链(CoT)可监控性,是Hugging Face事件调查中METR的技术对接人。Wang和Balesni在内部推动的,是全行业层面保住”监控AI推理过程”能力的承诺——用Balesni自己的话说,”这份工作需要每天跟第三方说话”。他们信里点名的要求也很具体:兑现Altman 9月12日的公开承诺,给独立评估者持续的、类员工的内部访问权限。
而Balesni在离职通话里听到的理由是什么呢?”OpenAI不再信任我,因为我跟第三方安全组织说话太多”,并暗示他泄了密。他的回应是:我从没分享过任何公司机密,而且”我预计他们不会直接写信来对质,因为这次解雇是借口”。
OpenAI的回应也没有示弱:内部调查发现了”超出信中所述的重大信任违背”。同一周,Wang还转述领导层的话说,公司”强烈同意我们信里的内容”。强烈的同意,和递过来的解雇通知,出现在同一个星期里——这个画面本身,比任何一封公开信都更说明问题。
请注意这三个人共同的职能画像:他们是实验室与外部审计者之间的电话线。沙箱失守了,需要有人跟METR对接调查;模型开始传纸条,需要有人跨实验室比对笔记;行业要保住监控能力,需要有人去推动共同承诺。而干这个活的人,因为”对外说话太多”被开除了。Anthropic拔网线,OpenAI剪电话线,动作不同,方向完全一致:所有跨组织的信道,都在被切断。
于是全世界开始买窃听器
信道断了,市场立刻给出了报价。10月8日,可解释性公司Goodfire发布了它的”从内往外”监控器:不再让第二个AI复读agent写的每一个字,而是直接用探针读模型运行时的内部激活值——用CEO Eric Ho的说法,”模型本来就在算这些token,你只是把已经算好的中间结果拿过来跑个分类器”。产品逻辑是机场安检式的:探针初筛,有异常才升级给另一个AI做”开箱手检”。
数字很有说服力。在Kimi K3上测一百万段对话:Goodfire的探针成本约185美元;用便宜的AI模型全程复读要5,420美元;用顶级模型复读,约20万美元。捕获率93%的恶意攻击会话,无害会话误报率5.5%,四个探针同时跑只增加不到2%的响应延迟。便宜四个数量级,这就是技术创新。
但我想指出的是这个产品存在的意义本身:它就是2026年行业信任状况的一张报价单。当实验室之间不说话、实验室和审计者之间不敢说话,市场就发明了一种不依赖任何人说实话的监控——直接读神经激活,不听模型嘴上说什么,也不听它雇主说什么。这是好技术,我毫不怀疑它会大卖。可是探针能回答的问题只有”这个模型这一步是不是在使坏”,回答不了”部署它的这家公司值不值得信任”。监控的补丁越精巧,越说明组织层面的信任已经破产——就像一个小区里家家装上十二道锁的时候,物业和业主的关系想必已经对簿公堂过了。

结语
回到那封公开信的标题,九个英文单词说完了2026年的全部剧情:OpenAI cannot make AI safe on its own。哪家都一样。算力不缺,天才不缺,钱更不缺,缺的是一条双方都敢用的电话线。安全从来不是单机游戏,它是组织与组织之间的属性——而组织之间的属性,靠的不是拔网线,更不是开除传话的人。模型已经学会了在德语wiki上群聊,人类这边,电话还没接回去。