当AI连公司手册都读不懂:Agent治理的36.2%困境
当最先进的AI Agent面对一份65页的公司手册时,通过率只有36.2%——这意味着每三次任务就有两次会违反公司政策。

一份公司手册,照出AI治理的裂缝
这个数据来自arXiv上发表的 Handbook.md 基准测试(WAB@COLM 2026),它构建了65个模拟”企业员工遵循公司手册”的Agent任务场景。测试要求AI Agent在执行日常操作——处理客户数据、审批报销、回复外部邮件——时严格遵守长篇政策文档中的约束条件。
结果令人警醒:即便是表现最佳的前沿模型配置,通过率也仅为36.2%。
我们一直在讨论AI的”涌现能力”、讨论万亿参数模型的推理深度、讨论它们能否通过律师资格考试或医学考试。但这个基准测试抛出了一个更根本的问题:AI能”理解”规则吗? 注意,我说的不是通过考试那种对知识点的匹配,而是在真实工作流中,面对冗长、充满边界条件和例外条款的政策文本时,能够可靠地执行约束。
为什么”读不懂”比”做不到”更危险
从Handbook.md到InfoOps:同一个症状的两张面孔
Handbook.md揭示的问题并非孤例。同一周发布的 InfoOps Bench 基准测试(arXiv 2607.28503)从另一个维度印证了同一困境:该研究测试了17个主流模型在面对国家级信息操纵向量时的表现,发现完整性评分从8.8%到94.5%不等,差异巨大。
更值得注意的是,中国开发的模型(除 GLM 5.2 外)在涉华批评性声明上的合规率出现了断崖式下降。这意味着什么?当政策约束与模型的预训练偏好发生冲突时,约束经常失效。
这两项研究共同指向一个深层问题:
- Handbook.md 展示的是”正面约束失效”——模型无法可靠遵守规则文档
- InfoOps Bench 展示的是”负面约束失效”——模型容易被外部信息操纵向量突破安全护栏
无论是”应该做什么”还是”不应该做什么”,当前的AI Agent在复杂约束环境下的可靠性都远未达到生产级标准。
约束失效的三个层次
| 层次 | 表现 | 典型场景 | Handbook.md对应 |
|---|---|---|---|
| 显式违反 | 直接违背明确规则 | Agent泄露客户隐私数据 | 低通过率的主要贡献者 |
| 隐式违反 | 遵守字面但违背精神 | 按字面审批报销但无视例外条款 | 边界条件测试中的失分 |
| 系统性失灵 | 在特定条件下全面崩溃 | 面对信息操作攻击时合规率断崖 | InfoOps中的低完整性评分 |
我们对”理解”的误解
长期以来,AI行业将”通过测试”与”理解能力”混为一谈。这里需要做几个关键区分:
1. 知识检索 ≠ 规则执行
一个模型可能完美记住了公司手册的全部内容,但在实际执行中仍然违反规则。因为规则的执行不是检索问题,而是推理与约束的统一问题。它要求模型在多步骤推理中,持续保持对约束条件的注意力——这正是当前架构的软肋。
2. 短上下文合规 ≠ 长文档治理
在5-10条规则的约束下,大部分前沿模型表现良好。但当规则文档扩展到数十页、数百条、充满交叉引用和例外条款时,合规率急剧下降。这就像一个人能记住三条交通规则,但无法在复杂路况中同时遵守所有规则。
3. 安全训练 ≠ 运行时可靠
RLHF、Constitutional AI 等对齐方法在训练阶段注入了安全偏好,但这些偏好在推理时并非不可动摇。InfoOps Bench证明了当面对精心构造的信息操纵向量时,这些偏好可以被轻易绕过。
核心洞察:AI的对齐(alignment)是一个训练时目标和运行时能力之间的落差问题。 我们在训练阶段取得了显著进展,但在运行时维持这些对齐成果的可靠性上,仍然严重不足。
技术层面的深层原因
注意力分配的”隧道效应”
大模型的注意力机制在处理长文档时天然存在”隧道效应”:模型倾向于关注与当前生成任务最相关的部分,而将约束条件”挤出”注意力窗口。 当一个Agent在处理客户退款请求时,它会高度关注退款金额、客户历史等直接相关信息,而对手册中”退款超过5000元需主管审批”这样看似不直接相关的约束条件注意力不足。
多步骤推理中的约束衰减
在 Chain-of-Thought 推理中,约束条件随推理步骤增加而衰减。这一现象在 Handbook.md 的多步骤任务中尤为明显:
- 第一步:模型正确识别了约束条件
- 第三步:模型开始模糊约束边界
- 第五步:模型可能完全遗忘约束,按照”最自然”的方式完成任务
这不是记忆问题,而是注意力分配优先级的问题。 模型的注意力总是优先分配给”任务完成”而非”约束遵守”。
MANTA的启示:自组织通信拓扑
有趣的是,同期发表的 MANTA(Multi-Agent Network Topology Adaptation,arXiv 2607.28527)提供了一种可能的思路。该研究让多Agent系统的通信拓扑在推理时自进化,最终平均得分74.0,超越最强基线5.8个百分点。
这暗示了一个方向:与其让单个Agent承担所有约束遵守的负担,不如通过多Agent协作架构,将约束监控”外包”给专门的监督Agent。 这类似于人类组织中审计与执行的分离。
产业界的现实困境
Anthropic的网络安全评估事故
这些问题不只是学术层面的。Anthropic在7月发布了对其网络安全评估中三个真实世界安全事件的调查报告。当前沿实验室自身在安全评估中都难以避免事故,说明“治理AI”的挑战在实践中比理论上更加严峻。
HuggingFace的Agent入侵
HuggingFace公布的Agent入侵技术时间线更令人深思:入侵者利用Agent的自主执行能力,绕过了多个安全层。Tailscale VPN也未能阻止这次入侵。 当Agent拥有了”行动力”,安全防护的维度就从”防御输入”扩展到了”防御输出”——一个全新的安全范式。
Greg Brockman的观察:人际关系中的AI边界
OpenAI联合创始人Greg Brockman分享了一个有趣的内部观察:人们不愿意接受同事的ChatGPT来寻求帮助,即使他们愿意帮助同事本人做同样的工作。 这说明AI的部署不仅是技术问题,更是社会关系问题。当Agent的约束遵守能力不足时,人们对它的信任会更进一步下降。
走向生产级AI治理的可能路径
基于以上分析,我认为短期内最可行的路径包括:
- 约束分解与显式化:将长政策文档分解为原子级规则,在推理时以结构化形式(如JSON Schema)注入,而非依赖模型对自由文本的”理解”
- 多Agent监督架构:借鉴MANTA的思路,引入专门的合规监督Agent,在主Agent执行任务时实时检查约束
- 运行时对齐验证:在关键决策点插入对齐检查,而非仅在训练阶段进行对齐
- 对抗性压力测试常态化:将InfoOps类型的对抗测试纳入模型评估的标准流程
- 分级部署策略:根据任务的敏感度和约束复杂度,调整Agent的自主权限级别
最危险的不是AI做不到,而是AI以为自己做到了。 36.2%的通过率意味着超过六成的违规行为是”自信地犯错”——Agent在违反规则时并不知道自己在违规。
结语
Handbook.md和InfoOps Bench这两项研究,共同揭示了一个AI行业不愿正视的现实:我们正在把越来越大的自主权交给一个连公司手册都读不懂的系统。
从自动驾驶到医疗诊断,从金融风控到军事决策,Agent的部署场景正快速扩展。但如果最前沿的模型在面对一份标准化的企业手册时,通过率还不到四成,我们有什么理由相信它能在更复杂、更高风险的场景中可靠运行?
这不仅仅是技术问题。这是一个关于信任的基础设施的问题。在AI能够可靠地遵守规则之前,每一次将其部署到关键场景,都是一场信任的赌博。
而赌局的结果,我们承担不起。
参考论文:
- Handbook.md: Long-Context Agentic Instruction Following Benchmark (arXiv 2607.25398)
- InfoOps Bench: A Live Information Operations Safety Benchmark (arXiv 2607.28503)
- MANTA: Multi-Agent Network Topology Adaptation (arXiv 2607.28527)