rhesis-ai/rhesis

The collaboration layer for AI teams: domain experts annotate and review agent behavior, engineers improve the agent from what they find.

解决的问题

Rhesis 为构建 AI 代理时,提供了一种结构化的方式,用于收集和利用领域专家和产品经理的反馈。它弥合了了解正确答案的人员(利益相关者)与构建代理的工程师之间的差距,确保反馈与特定测试用例和代理版本相关联,而不是在聊天线程中丢失。

如何工作

用户通过 Python SDK(使用 WebSocket 实现本地或 VPC 访问)或公共 REST 端点连接其 AI 代理。利益相关者随后使用基于 Web 的沙盒与实时代理互动,将对话转化为测试用例,并提供结构化的通过/失败判断及评论。这些反馈随后通过 SDK、REST API 或支持 MCP 的客户端(如 Cursor 和 Claude Code)被拉回开发流程。随着时间推移,自然语言反馈将被转化为自动化测试和指标。

适用人群

  • AI 工程师:将反馈和审核过的测试集集成到其 CI/CD 流水线和开发工作流中。
  • 领域专家:测试代理并提供关于准确性和行为的定性反馈,无需编写代码。
  • 产品经理:定义需求,并将分散的反馈转化为可衡量的测试和指标。

主要亮点

  • 集成的反馈循环:连接实时代理交互与结构化评审及自动化评估。
  • 灵活的连接方式:支持基于 SDK 的 WebSocket 连接(无需公共 URL)和 REST 端点。
  • 自动化测试生成:从需求、PRD 或连接的工具(如 Notion、GitHub、Jira)生成测试。
  • 全面的评估能力:包含 60 多个指标(DeepEval、garak)和 LLM-as-Judge 评估器。
  • 开发者工具:提供 MCP 技能,可直接集成到 Cursor 等 AI 驱动的 IDE 中。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目