rhesis-ai/rhesis

The collaboration layer for AI teams: domain experts annotate and review agent behavior, engineers improve the agent from what they find.

解決的問題

Rhesis 為建構 AI 代理時,提供一種結構化的方式,用以收集並利用領域專家與產品經理的回饋。它彌合了了解正確答案的人員(利益相關者)與建構代理的工程師之間的差距,確保回饋與特定測試案例和代理版本相關聯,而非在聊天線程中遺失。

如何運作

使用者透過 Python SDK(使用 WebSocket 實現本地或 VPC 存取)或公開 REST 端點連接其 AI 代理。利益相關者隨後使用基於 Web 的沙盒與即時代理互動,將對話轉化為測試案例,並提供結構化的通過/失敗判斷與評論。這些回饋隨後透過 SDK、REST API 或支援 MCP 的客戶端(如 Cursor 和 Claude Code)被拉回開發流程。隨著時間推移,自然語言回饋將被轉化為自動化測試與指標。

適用對象

  • AI 工程師:將回饋與審核過的測試集整合至其 CI/CD 流水線與開發工作流程中。
  • 領域專家:測試代理並提供關於準確性與行為的定性回饋,無需撰寫程式碼。
  • 產品經理:定義需求,並將分散的回饋轉化為可衡量的測試與指標。

主要亮點

  • 整合的回饋循環:連結即時代理互動與結構化審核及自動化評估。
  • 彈性的連接方式:支援基於 SDK 的 WebSocket 連接(無需公開 URL)與 REST 端點。
  • 自動化測試生成:從需求、PRD 或連結的工具(如 Notion、GitHub、Jira)生成測試。
  • 全面的評估能力:包含超過 60 個指標(DeepEval、garak)與 LLM-as-Judge 評估器。
  • 開發者工具:提供 MCP 技能,可直接整合至 Cursor 等 AI 驅動的 IDE 中。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案