Ajay150313/agentsre

SRE reliability instrumentation for agentic AI — DQR, TIE, HER, AQD

해결하는 문제

전통적인 관측 도구(Datadog 또는 CloudWatch 등)는 인프라 상태(HTTP 200, 지연 시간, 가용성)를 모니터링하지만, AI 에이전트가 기술적으로는 실행 중이지만 잘못된 결정을 내리거나, 인간에게 과도하게 작업을 에스컬레이션하거나 비효율적으로 작동하는 "의미적 실패(semantic failures)"를 감지하지 못합니다. agentsre는 아젠트 AI의 의미적 계층에 특화된 사이트 신뢰성 공학(SRE) 인스트루멘테이션을 제공하여 '에이전트 확산(agent sprawl)'과 행동의 변동(behavioral drift)으로 인한 생산 환경 장애를 예방합니다.

작동 방식

이 라이브러리는 에이전트 행동을 모니터링하기 위한 전용 서비스 수준 지표(SLIs) 및 거버넌스 도구를 구현합니다.

  • 의미적 SLI: 결정 품질률(DQR), 도구 호출 효율(TIE), 인간 에스컬레이션률(HER), 승인 대기열 깊이 변화(AQDD)를 추적하여 시스템 장애가 발생하기 전에 품질 저하를 식별합니다.
  • A2A 검증: 에이전트 간(A2A) 의미적 경계 검증기로, 한 에이전트의 출력이 다음 에이전트 체인에 전달되기 전에 의미적으로 올바른지 확인합니다.
  • 회로 차단기: 검증 성공률이 특정 임계값 이하로 떨어지면 자동으로 트리거되어 요청을 저하 모드 핸들러로 라우팅합니다.
  • 플릿 거버넌스: 모델 버전, SLO 소유자, 폐기 일자를 추적하는 인벤토리 시스템과, 행동의 변동이 감지되면 에이전트 프레임워크(LangChain 등) 업그레이드를 방지하는 프레임워크 캐니발 프레임워크를 제공합니다.
  • 자율성 제약: SLI 위반에 따라 에이전트의 자율성(예: 자율적 작성에서 인간 승인만 허용)을 자동으로 낮추는 "제약 계단(constraint ladder)"을 구현합니다.

대상 사용자

다중 모델, 다중 프레임워크의 아젠트 AI 시스템을 생산 환경에 배포하는 SRE 및 AI 엔지니어. 기초 인프라 모니터링을 넘어 행동 신뢰성까지 확보하고자 하는 분들에게 적합합니다.

주요 특징

  • 4가지 핵심 의미적 SLI: 일반적인 건강 체크로는 감지할 수 없는 실패를 탐지하도록 설계되었습니다.
  • AWS 통합: AWS CloudWatch 커스텀 메트릭을 위한 내장 발행기 제공.
  • 에이전트 확산 억제: 플릿 인벤토리 및 프레임워크 업그레이드 캐니발 도구 제공.
  • 의미적 가드레일: HTTP 상태 코드가 아닌 결정 품질 기반으로 작동하는 A2A 검증 및 회로 차단기.
  • 비용 추적: 에이전트 및 작업별 실시간 비용 추적 모듈 제공.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트