rhesis-ai/rhesis

Get the knowledge you need to develop your agents. The collaboration layer for AI teams: domain experts annotate and review agent behavior, engineers improve the agent from what they find.

What it solves

Rhesis는 LLM 및 에이전트 애플리케이션 검증을 수동적인 일회성 감사에서 지속적이고 팀 기반 프로세스로 전환하기 위해 설계된 협업 테스트 플랫폼입니다. AI 출력의 비결정적 특성을 자동 테스트 생성, 적대적 레드팀 테스트, 다양한 메트릭을 활용한 구조화된 평가 도구를 제공함으로써 해결합니다.

How it works

플랫폼은 Python SDK와 협업 UI를 통해 AI 개발 라이프사이클에 통합됩니다. AI 기반 합성을 사용해 자연어 요구사항으로부터 테스트 시나리오를 생성하고, 파일 또는 MCP를 통해 컨텍스트 소스에 연결해 테스트가 지식 인식을 갖도록 합니다.

실행 시에는 사용자의 애플리케이션에 지속적인 아웃바운드 WebSocket 연결을 설정하여 공개 URL 없이도 Rhesis가 원격으로 테스트를 트리거할 수 있게 합니다. OpenTelemetry를 활용해 LLM 호출 및 지연 시간을 추적하고, LiteLLM을 이용해 테스트 생성 및 평가에 100개 이상의 모델 제공자를 지원합니다.

Who it’s for

  • Engineers: AI 테스트를 CI/CD 파이프라인에 통합하고 트레이스를 통해 실패를 디버깅해야 하는 엔지니어.
  • Product Managers and Domain Experts: 코드를 작성하지 않고 행동 요구사항을 정의하고 평가 결과를 검토하고자 하는 제품 관리자 및 도메인 전문가.
  • Security Teams: 지속적인 적대적 테스트(레드팀)를 통해 jailbreak 및 PII 유출을 탐지하려는 보안 팀.

Highlights

  • AI-Powered Test Synthesis: 간단한 요구사항으로부터 수백 개의 엣지 케이스와 적대적 프롬프트를 생성.
  • Adversarial Agents: 레드팀 테스트용 Polyphemus 에이전트와 취약점 스캔용 Garak 통합 포함.
  • Conversation Simulation: Penelope 에이전트가 현실적인 다중 턴 대화를 시뮬레이션하여 컨텍스트 유지와 일관성을 테스트.
  • Extensive Metrics: RAGAS, DeepEval 등 프레임워크에서 제공되는 60개 이상의 사전 구축 메트릭을 사용하고, LLM-as-Judge로 추론.
  • Deep Observability: OpenTelemetry 기반 트레이싱으로 LangChain, LangGraph 및 기타 주요 에이전트 프레임워크를 지원.