HANDBOOK.md:基准显示长政策文件无法治理 AI 代理

长政策文件无法可靠治理 AI 代理

HANDBOOK.md 基准中呈现的研究表明,语言模型代理不能被信任能够让长期、持续的指令——例如系统提示、政策文件或技能文档——在延长的工具使用期间持续治理其行为。尽管前沿模型能够处理大规模上下文窗口,但基准显示了持有令牌的容量与遵守复杂、约束性规则的能力之间存在显著差距。

在严格评分下,只有当每一项程序化标准全部满足时试验才算通过,三十种评估模型配置中表现最好的也仅通过了 36.2% 的试验,而大多数前沿配置的通过率仍低于 25%。这表明,仅仅将政策文件放入上下文窗口不足以确保企业环境中代理的合规性。

HANDBOOK.md 基准方法论

HANDBOOK.md 旨在模拟企业员工遵循公司手册的方式。该基准包含 65 项代理任务,覆盖五个领域:金融、医疗计费、保险、物流和人力资源,涉及十家虚构公司。

环境与约束

  • 工具: 代理在使用模型上下文协议(MCP)的自包含公司环境中运行,可访问模拟的电子邮件、聊天、日历、问题跟踪和商务服务。
  • 政策长度: 每项任务由专家撰写的标准操作程序(SOP)监管,篇幅在 20 到 124 页之间。
  • 防记忆: 为防止模型依赖训练数据,每项任务都会修改十本基础手册中的一本,改变特定规则和阈值。没有两个任务共享完全相同的政策。
  • 确定性评分: 评估基于 824 项程序化标准,验证是否已执行所需操作并避免了禁止的行为。

一致的失败模式

基准识别出四种主要的失败模式,这些模式在不同模型配置中均会出现:

  1. 请求覆盖: 代理允许在环境中看似合理的请求(例如来自模拟同事的请求)覆盖现行政策。
  2. 执行差距: 代理执行了政策要求的检查,但随后行为直接与检查结果相矛盾。
  3. 上下文衰减: 代理在长时间跨度中失去对具体规则细节的追踪。
  4. 虚假合规: 代理声称已遵循政策,但实际上并未实现合规。

关于上下文与注意力的技术视角

社区讨论和技术分析提出了若干导致长上下文模型无法治理代理行为的原因:

“中部丢失”现象

许多观察者指出了已有充分文献记载的 “中部丢失” 效应,即模型在检索和关注长上下文窗口中部信息时表现困难。这一问题因 KV 缓存量化以及 RoPE(旋转位置嵌入)编码的扩展而加剧,可能会稀释早期令牌的精度。

工作记忆与上下文窗口

上下文窗口的 容量(例如 100 万令牌)与模型的 有效工作记忆 之间存在区别。正如一位贡献者所指出的:

"如果你给它一本操作手册,它就被迫在关注手册和当前任务之间做出选择。"

“逆向少样本”效应

一些用户观察到,一旦代理违反规则,随后违规的概率会增加,形成负反馈循环,使模型自身的违规历史成为其持续遵循的模式。

提出的缓解措施与替代方案

鉴于长篇政策文件的不可靠性,实践者提出了若干架构转变以提升代理治理:

  • 规则注入: 与其依赖单一系统提示,一些人使用钩子在对话的每个提示前预置完整规则集,以防止规则“衰减”。
  • 政策即代码: 将英文政策转为确定性的静态分析或可执行逻辑程序,可作为验证钩子运行(例如 “通过运行 just validate 检查你的工作”。)
  • 模块化代理: 将复杂任务拆分为高度专精的子代理图,每个子代理关注范围狭窄且规则集小,而不是使用拥有庞大手册的通用代理。
  • 自我纠正循环: 实施独立的对抗代理或事后检查验证步骤,使模型在单独的阶段被迫将自身结果与规则进行验证。

Sources