rhesis-ai/rhesis

The collaboration layer for AI teams: domain experts annotate and review agent behavior, engineers improve the agent from what they find.

何を解決するか

Rhesis は、AIエージェントを開発する際、ドメインエキスパートやプロダクトマネージャーからのフィードバックを構造化して収集・活用する方法を提供します。正解を知る人々(ステークホルダー)とエージェントを開発するエンジニアの間のギャップを埋め、フィードバックを特定のテストケースやエージェントバージョンに関連付けることで、チャットスレッドに消えてしまうような情報の損失を防ぎます。

動作方法

ユーザーは Python SDK(ローカルまたはVPCアクセス用にWebSocketを使用)またはパブリックなRESTエンドポイントを通じてAIエージェントを接続します。ステークホルダーはWebベースのプレイグラウンドを使ってライブエージェントと対話し、会話からテストケースを作成し、構造化された成功/失敗の評価とコメントを提供します。このフィードバックは、SDK、REST API、またはCursorやClaude CodeのようなMCP対応クライアントを通じて開発プロセスに戻されます。時間とともに、文章によるフィードバックは自動テストとメトリクスに変換されます。

対象ユーザー

  • AIエンジニア: フィードバックとレビュー済みのテストセットをCI/CDパイプラインや開発ワークフローに統合するため。
  • ドメインエキスパート: コードを書かずにエージェントをテストし、正確性や挙動に関する定性的なフィードバックを提供するため。
  • プロダクトマネージャー: 要件を定義し、散在するフィードバックを測定可能なテストとメトリクスに変換するため。

主な特徴

  • 統合されたフィードバックループ: ライブエージェントの対話と構造化されたレビュー、自動評価をつなぐ。
  • 柔軟な接続性: SDKベースのWebSocket接続(パブリックURL不要)とRESTエンドポイントの両方をサポート。
  • 自動テスト生成: 要件、PRD、またはNotion、GitHub、Jiraなどの接続ツールからテストを生成。
  • 包括的な評価: 60以上のメトリクス(DeepEval、garak)とLLM-as-Judge評価者を含む。
  • 開発者ツールキット: CursorなどのAI搭載IDEとの直接統合を可能にするMCPスキルを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト