Ajay150313/agentsre

SRE reliability instrumentation for agentic AI — DQR, TIE, HER, AQD

解决的问题

传统的可观测性工具(如 Datadog 或 CloudWatch)监控基础设施健康状况(HTTP 200、延迟、可用性),但无法检测到“语义失败”——即 AI 代理在技术上仍在运行,但做出了错误决策、向人类过度升级任务或变得低效的情况。agentsre 为代理 AI 的语义层提供专门的站点可靠性工程(SRE)仪器,以防止由“代理泛滥”和行为漂移引起的生产环境故障。

工作原理

该库实现了一组专用的服务级别指标(SLIs)和治理工具,用于监控代理行为:

  • 语义 SLIs:跟踪决策质量率(DQR)、工具调用效率(TIE)、人工升级率(HER)和审批队列深度漂移(AQDD),在系统故障发生前识别性能退化。
  • A2A 验证:代理间(A2A)语义边界验证器确保一个代理的输出在传递给链中下一个代理之前在语义上是正确的。
  • 熔断器:如果验证成功率低于特定阈值,语义熔断器会自动触发,并将请求路由到降级模式处理器。
  • 舰队治理:库存系统跟踪模型版本、SLO 所有权和弃用日期,而框架金丝雀机制可在检测到行为漂移时阻止升级代理框架(如 LangChain)。
  • 自主性约束:根据 SLI 违规情况,"约束阶梯"可自动降低代理的自主性(例如,从自主编写变为仅限人工审批)。

适用人群

在生产环境中部署多模型、多框架代理 AI 系统的 SRE 和 AI 工程师,需要超越基础基础设施监控,实现行为可靠性保障。

主要亮点

  • 四大核心语义 SLIs:专为捕捉标准健康检查遗漏的故障而设计。
  • AWS 集成:内置 AWS CloudWatch 自定义指标发布器。
  • 遏制代理泛滥:提供舰队库存和框架升级金丝雀工具。
  • 语义护栏:基于决策质量而非 HTTP 状态码运行的 A2A 验证和熔断器。
  • 成本追踪:提供按代理和任务实时追踪成本的模块。

相关

  • 项目
  • 项目
  • 项目
  • 项目