Ajay150313/agentsre

SRE reliability instrumentation for agentic AI — DQR, TIE, HER, AQD

解決的問題

傳統的可觀測性工具(如 Datadog 或 CloudWatch)監控基礎設施健康狀況(HTTP 200、延遲、可用性),但無法檢測「語義失敗」——即 AI 代理在技術上仍在運行,但做出錯誤決策、過度將任務升級至人類,或變得低效的情況。agentsre 為代理 AI 的語義層提供專用的網站可靠性工程(SRE)儀器,以防止因「代理泛濫」與行為漂移所導致的生產環境故障。

工作原理

此套件實作一組專用的服務等級指標(SLIs)與治理工具,用以監控代理行為:

  • 語義 SLIs:追蹤決策品質率(DQR)、工具呼叫效率(TIE)、人工升級率(HER)與審核佇列深度漂移(AQDD),於系統故障發生前識別效能退化。
  • A2A 驗證:代理間(A2A)語義邊界驗證器確保一個代理的輸出在傳遞給鏈中下一個代理前,語義上正確無誤。
  • 熔斷器:若驗證成功率低於特定閾值,語義熔斷器會自動觸發,並將請求導向降級模式處理器。
  • 艦隊治理:庫存系統追蹤模型版本、SLO 所有權與停用日期,而框架金絲雀機制可在偵測到行為漂移時阻止升級代理框架(如 LangChain)。
  • 自主性約束:根據 SLI 違規情況,「約束階梯」可自動降低代理的自主性(例如,從自主撰寫轉為僅限人工審核)。

適用對象

在生產環境中部署多模型、多框架代理 AI 系統的 SRE 與 AI 工程師,需要超越基礎基礎設施監控,實現行為可靠性保障者。

主要亮點

  • 四大核心語義 SLIs:專為捕捉標準健康檢查所遺漏的故障而設計。
  • AWS 集成:內建 AWS CloudWatch 自訂指標發佈器。
  • 遏制代理泛濫:提供艦隊庫存與框架升級金絲雀工具。
  • 語義護欄:基於決策品質而非 HTTP 狀態碼運作的 A2A 驗證與熔斷器。
  • 成本追蹤:提供按代理與任務即時追蹤成本的模組。

相關

  • 專案
  • 專案
  • 專案
  • 專案