rhesis-ai/rhesis
Get the knowledge you need to develop your agents. The collaboration layer for AI teams: domain experts annotate and review agent behavior, engineers improve the agent from what they find.
What it solves
Rhesis 是一个协作式测试平台,旨在将 LLM 与代理应用的验证从手动、一次性的审计,转变为持续、团队式的过程。它通过提供自动化测试生成、对抗性红队测试以及使用多种指标的结构化评估工具,解决 AI 输出非确定性的难题。
How it works
平台通过 Python SDK 与协作 UI 集成到 AI 开发生命周期。它使用 AI 驱动的合成技术,从自然语言需求生成测试场景,并连接到上下文来源(通过文件或 MCP)以确保测试具备知识感知。
在执行阶段,平台会建立持久的外部 WebSocket 连接到用户的应用程序,允许 Rhesis 远程触发测试,无需公开 URL。它利用 OpenTelemetry 追踪 LLM 调用和延迟,并使用 LiteLLM 支持超过 100 种模型提供商,用于测试生成和评估。
Who it’s for
- Engineers 需要将 AI 测试集成到 CI/CD 流水线,并通过追踪调试失败。
- Product Managers and Domain Experts 定义行为需求并审阅评估结果,无需编写代码。
- Security Teams 寻求持续的对抗性测试(红队测试),以检测 jailbreak 和个人信息泄露。
Highlights
- AI-Powered Test Synthesis:从简单需求生成数百个边缘案例和对抗性提示。
- Adversarial Agents:内置 Polyphemus 代理进行红队测试,并集成 Garak 进行漏洞扫描。
- Conversation Simulation:Penelope 代理模拟真实的多轮对话,以测试上下文保持和连贯性。
- Extensive Metrics:超过 60 项预构建指标,来自 RAGAS、DeepEval 等框架,使用 LLM-as-Judge 进行推理。
- Deep Observability:基于 OpenTelemetry 的追踪,支持 LangChain、LangGraph 及其他主要代理框架。