rhesis-ai/rhesis

Get the knowledge you need to develop your agents. The collaboration layer for AI teams: domain experts annotate and review agent behavior, engineers improve the agent from what they find.

What it solves

Rhesis 是一個協作式測試平台,旨在將 LLM 與代理應用的驗證從手動、一次性的稽核,轉變為持續、團隊式的流程。它透過提供自動化測試生成、對抗性紅隊測試以及使用多種指標的結構化評估工具,解決 AI 輸出非決定性的問題。

How it works

平台透過 Python SDK 與協作式 UI 整合至 AI 開發生命週期。它使用 AI 驅動的合成技術,從自然語言需求產生測試情境,並連接至上下文來源(透過檔案或 MCP)以確保測試具備知識感知。

在執行階段,平台會建立持續的外部 WebSocket 連線至使用者的應用程式,讓 Rhesis 能遠端觸發測試,無需公開 URL。它使用 OpenTelemetry 追蹤 LLM 呼叫與延遲,並利用 LiteLLM 支援超過 100 種模型供應商,供測試生成與評估使用。

Who it’s for

  • Engineers 需要將 AI 測試整合至 CI/CD 流程,並透過追蹤除錯失敗。
  • Product Managers and Domain Experts 定義行為需求並審閱評估結果,無需撰寫程式碼。
  • Security Teams 尋求持續的對抗性測試(紅隊測試),以偵測 jailbreak 與個資洩漏。

Highlights

  • AI-Powered Test Synthesis:從簡單需求產生數百個邊緣案例與對抗性提示。
  • Adversarial Agents:內建 Polyphemus 代理進行紅隊測試,並整合 Garak 進行漏洞掃描。
  • Conversation Simulation:Penelope 代理模擬真實的多輪對話,以測試上下文保留與連貫性。
  • Extensive Metrics:超過 60 項預建指標,來自 RAGAS、DeepEval 等框架,使用 LLM-as-Judge 進行推理。
  • Deep Observability:基於 OpenTelemetry 的追蹤,支援 LangChain、LangGraph 及其他主要代理框架。