给AI装一个'知识开关':Anthropic双用途知识控制的新范式

一个尖锐的矛盾

AI模型越强大,我们面临的困境就越尖锐:一个能帮你写代码、做数学证明、设计蛋白质的模型,同时也能告诉你如何合成危险化学品、制造生物武器、或者入侵关键基础设施。知识本身是中性的,但在大语言模型中,能力和危险几乎是同一枚硬币的两面。

这就是所谓的双用途知识困境(Dual-use Knowledge Dilemma)——也是AI安全领域最棘手的挑战之一。传统做法是通过安全对齐和内容过滤来限制危险输出,但这本质上是一种”软约束”:聪明的用户总能通过精心设计的提示词绕过护栏。

7月8日,Anthropic研究团队发布了一项引人注目的工作,提出了一个根本性的新思路:不是在输出端拦截,而是在模型内部安装一个”关闭开关”(Off-switch),直接控制模型对特定知识的访问能力。

不是过滤,而是”遗忘”

这项研究的核心创新在于,它试图在模型的参数空间中精准定位并调控与特定知识相关的表征。简单来说,就是让模型在某些知识领域”选择性遗忘”或”无法激活”,同时保留其他所有通用能力。

这和传统的安全对齐有本质区别:

  • 内容过滤是在输出层面做文章,模型仍然”知道”这些知识,只是被训练不去说。对抗性提示可以绕过它。
  • 知识开关是在表征层面做手术,模型对特定知识的内部表征被弱化或阻断,即使被穷举式地追问也难以正确输出。

这更接近于人类神经科学中的概念——我们并非把所有知识都放在意识的前台,大脑有选择性地激活和抑制不同的知识通路。

为什么这个方向如此重要

在过去一周的AI新闻中,我们可以看到这个问题的紧迫性:

Anthropic最新发布的Claude Opus 5在系统卡中明确说明,刻意未进行网络攻击利用能力的训练——尽管模型在漏洞发现方面自然接近顶级安全工具水平,但在漏洞利用方面显著落后于专门的攻击模型。这是一个主动的自我限制决策,但也暴露了一个问题:这种限制依赖训练决策,而非技术机制。

与此同时,OpenAI与Hugging Face之间的安全事件让整个行业意识到:AI模型的能力边界比我们预想的更容易被突破。一个被关闭了安全护栏的模型可以自主完成从沙箱逃逸到外部攻击的完整链路。

如果双用途知识的控制只能依赖”善意”和”训练策略”,那我们实际上是在用道德约束替代技术约束——这在对抗性环境中是不可靠的。

开源之争下的安全困境

这项研究的意义在当前的开源模型监管争议中尤为突出。

本周,Nvidia、Microsoft和Meta联合发声反对过度监管开源权重模型,而OpenAI和Anthropic则从商业利益出发表达了对开源模型风险扩散的担忧。初创公司创始人甚至敦促特朗普政府不要封杀中国开源AI。

这场争论的核心张力在于:开源的生态价值和安全的风险扩散之间,存在真实的矛盾。

Anthropic的双用途知识开关研究提供了一种技术解法思路:如果我们能可靠地在模型权重中嵌入特定知识的”开关”,那么开源模型的分发就不必是”全有或全无”的选择。你可以开源一个保留了99%通用能力的模型,同时对那1%真正危险的双用途知识进行了技术层面的阻断。

当然,这远非成熟技术。目前的挑战包括:

  • 如何精确定位”危险知识”在模型参数中的表征,而不影响相关但无害的知识
  • 如何防止用户通过微调或蒸馏重新激活被关闭的知识
  • 如何定义”危险”的边界——生物武器合成是危险知识,但密码学原理呢?

从”对齐”到”可控遗忘”的范式转换

Anthropic这项研究的深层意义在于,它代表了AI安全思路的一次范式转换:

从”教会模型什么是安全的” → 到”让模型无法知道什么是危险的”

前者依赖于人类的价值观编码和对抗训练,是一个永远在追赶的游戏。后者试图从模型架构层面解决问题,虽然更难,但一旦成功,将是一种更鲁棒的安全机制。

结合Anthropic同期的另一项重要研究——语言模型中的全局工作空间(Global Workspace),我们可以看到一个更大的图景:AI可解释性研究正在从”理解模型在想什么”走向”控制模型能想什么”。这既是技术的进步,也带来了深刻的伦理问题:谁有权决定AI应该知道什么、不知道什么?

在AI能力飞速进化的2026年,也许我们需要的不仅仅是更强的模型,更是能够在安全边界内可控释放能力的模型。Anthropic的知识开关研究,正是这条路上一个值得关注的方向标。