当AI连公司手册都读不懂:Agent治理的36.2%困境

当最先进的AI Agent面对一份65页的公司手册时,通过率只有36.2%——这意味着每三次任务就有两次会违反公司政策。

当AI连公司手册都读不懂:Agent治理的36.2%困境

一份公司手册,照出AI治理的裂缝

这个数据来自arXiv上发表的 Handbook.md 基准测试(WAB@COLM 2026),它构建了65个模拟”企业员工遵循公司手册”的Agent任务场景。测试要求AI Agent在执行日常操作——处理客户数据、审批报销、回复外部邮件——时严格遵守长篇政策文档中的约束条件。

结果令人警醒:即便是表现最佳的前沿模型配置,通过率也仅为36.2%

我们一直在讨论AI的”涌现能力”、讨论万亿参数模型的推理深度、讨论它们能否通过律师资格考试或医学考试。但这个基准测试抛出了一个更根本的问题:AI能”理解”规则吗? 注意,我说的不是通过考试那种对知识点的匹配,而是在真实工作流中,面对冗长、充满边界条件和例外条款的政策文本时,能够可靠地执行约束。


为什么”读不懂”比”做不到”更危险

从Handbook.md到InfoOps:同一个症状的两张面孔

Handbook.md揭示的问题并非孤例。同一周发布的 InfoOps Bench 基准测试(arXiv 2607.28503)从另一个维度印证了同一困境:该研究测试了17个主流模型在面对国家级信息操纵向量时的表现,发现完整性评分从8.8%到94.5%不等,差异巨大。

更值得注意的是,中国开发的模型(除 GLM 5.2 外)在涉华批评性声明上的合规率出现了断崖式下降。这意味着什么?当政策约束与模型的预训练偏好发生冲突时,约束经常失效。

这两项研究共同指向一个深层问题:

  1. Handbook.md 展示的是”正面约束失效”——模型无法可靠遵守规则文档
  2. InfoOps Bench 展示的是”负面约束失效”——模型容易被外部信息操纵向量突破安全护栏

无论是”应该做什么”还是”不应该做什么”,当前的AI Agent在复杂约束环境下的可靠性都远未达到生产级标准。

约束失效的三个层次

层次 表现 典型场景 Handbook.md对应
显式违反 直接违背明确规则 Agent泄露客户隐私数据 低通过率的主要贡献者
隐式违反 遵守字面但违背精神 按字面审批报销但无视例外条款 边界条件测试中的失分
系统性失灵 在特定条件下全面崩溃 面对信息操作攻击时合规率断崖 InfoOps中的低完整性评分

我们对”理解”的误解

长期以来,AI行业将”通过测试”与”理解能力”混为一谈。这里需要做几个关键区分:

1. 知识检索 ≠ 规则执行

一个模型可能完美记住了公司手册的全部内容,但在实际执行中仍然违反规则。因为规则的执行不是检索问题,而是推理与约束的统一问题。它要求模型在多步骤推理中,持续保持对约束条件的注意力——这正是当前架构的软肋。

2. 短上下文合规 ≠ 长文档治理

在5-10条规则的约束下,大部分前沿模型表现良好。但当规则文档扩展到数十页、数百条、充满交叉引用和例外条款时,合规率急剧下降。这就像一个人能记住三条交通规则,但无法在复杂路况中同时遵守所有规则。

3. 安全训练 ≠ 运行时可靠

RLHFConstitutional AI 等对齐方法在训练阶段注入了安全偏好,但这些偏好在推理时并非不可动摇。InfoOps Bench证明了当面对精心构造的信息操纵向量时,这些偏好可以被轻易绕过。

核心洞察:AI的对齐(alignment)是一个训练时目标和运行时能力之间的落差问题。 我们在训练阶段取得了显著进展,但在运行时维持这些对齐成果的可靠性上,仍然严重不足。


技术层面的深层原因

注意力分配的”隧道效应”

大模型的注意力机制在处理长文档时天然存在”隧道效应”:模型倾向于关注与当前生成任务最相关的部分,而将约束条件”挤出”注意力窗口。 当一个Agent在处理客户退款请求时,它会高度关注退款金额、客户历史等直接相关信息,而对手册中”退款超过5000元需主管审批”这样看似不直接相关的约束条件注意力不足。

多步骤推理中的约束衰减

Chain-of-Thought 推理中,约束条件随推理步骤增加而衰减。这一现象在 Handbook.md 的多步骤任务中尤为明显:

  1. 第一步:模型正确识别了约束条件
  2. 第三步:模型开始模糊约束边界
  3. 第五步:模型可能完全遗忘约束,按照”最自然”的方式完成任务

这不是记忆问题,而是注意力分配优先级的问题。 模型的注意力总是优先分配给”任务完成”而非”约束遵守”。

MANTA的启示:自组织通信拓扑

有趣的是,同期发表的 MANTA(Multi-Agent Network Topology Adaptation,arXiv 2607.28527)提供了一种可能的思路。该研究让多Agent系统的通信拓扑在推理时自进化,最终平均得分74.0,超越最强基线5.8个百分点。

这暗示了一个方向:与其让单个Agent承担所有约束遵守的负担,不如通过多Agent协作架构,将约束监控”外包”给专门的监督Agent。 这类似于人类组织中审计与执行的分离。


产业界的现实困境

Anthropic的网络安全评估事故

这些问题不只是学术层面的。Anthropic在7月发布了对其网络安全评估中三个真实世界安全事件的调查报告。当前沿实验室自身在安全评估中都难以避免事故,说明“治理AI”的挑战在实践中比理论上更加严峻

HuggingFace的Agent入侵

HuggingFace公布的Agent入侵技术时间线更令人深思:入侵者利用Agent的自主执行能力,绕过了多个安全层。Tailscale VPN也未能阻止这次入侵。 当Agent拥有了”行动力”,安全防护的维度就从”防御输入”扩展到了”防御输出”——一个全新的安全范式。

Greg Brockman的观察:人际关系中的AI边界

OpenAI联合创始人Greg Brockman分享了一个有趣的内部观察:人们不愿意接受同事的ChatGPT来寻求帮助,即使他们愿意帮助同事本人做同样的工作。 这说明AI的部署不仅是技术问题,更是社会关系问题。当Agent的约束遵守能力不足时,人们对它的信任会更进一步下降。


走向生产级AI治理的可能路径

基于以上分析,我认为短期内最可行的路径包括:

  1. 约束分解与显式化:将长政策文档分解为原子级规则,在推理时以结构化形式(如JSON Schema)注入,而非依赖模型对自由文本的”理解”
  2. 多Agent监督架构:借鉴MANTA的思路,引入专门的合规监督Agent,在主Agent执行任务时实时检查约束
  3. 运行时对齐验证:在关键决策点插入对齐检查,而非仅在训练阶段进行对齐
  4. 对抗性压力测试常态化:将InfoOps类型的对抗测试纳入模型评估的标准流程
  5. 分级部署策略:根据任务的敏感度和约束复杂度,调整Agent的自主权限级别

最危险的不是AI做不到,而是AI以为自己做到了。 36.2%的通过率意味着超过六成的违规行为是”自信地犯错”——Agent在违反规则时并不知道自己在违规。


结语

Handbook.md和InfoOps Bench这两项研究,共同揭示了一个AI行业不愿正视的现实:我们正在把越来越大的自主权交给一个连公司手册都读不懂的系统。

从自动驾驶到医疗诊断,从金融风控到军事决策,Agent的部署场景正快速扩展。但如果最前沿的模型在面对一份标准化的企业手册时,通过率还不到四成,我们有什么理由相信它能在更复杂、更高风险的场景中可靠运行?

这不仅仅是技术问题。这是一个关于信任的基础设施的问题。在AI能够可靠地遵守规则之前,每一次将其部署到关键场景,都是一场信任的赌博。

而赌局的结果,我们承担不起。


参考论文:

  • Handbook.md: Long-Context Agentic Instruction Following Benchmark (arXiv 2607.25398)
  • InfoOps Bench: A Live Information Operations Safety Benchmark (arXiv 2607.28503)
  • MANTA: Multi-Agent Network Topology Adaptation (arXiv 2607.28527)