rhesis-ai/rhesis
The collaboration layer for AI teams: domain experts annotate and review agent behavior, engineers improve the agent from what they find.
何を解決するか
Rhesis は、AIエージェントを開発する際、ドメインエキスパートやプロダクトマネージャーからのフィードバックを構造化して収集・活用する方法を提供します。正解を知る人々(ステークホルダー)とエージェントを開発するエンジニアの間のギャップを埋め、フィードバックを特定のテストケースやエージェントバージョンに関連付けることで、チャットスレッドに消えてしまうような情報の損失を防ぎます。
動作方法
ユーザーは Python SDK(ローカルまたはVPCアクセス用にWebSocketを使用)またはパブリックなRESTエンドポイントを通じてAIエージェントを接続します。ステークホルダーはWebベースのプレイグラウンドを使ってライブエージェントと対話し、会話からテストケースを作成し、構造化された成功/失敗の評価とコメントを提供します。このフィードバックは、SDK、REST API、またはCursorやClaude CodeのようなMCP対応クライアントを通じて開発プロセスに戻されます。時間とともに、文章によるフィードバックは自動テストとメトリクスに変換されます。
対象ユーザー
- AIエンジニア: フィードバックとレビュー済みのテストセットをCI/CDパイプラインや開発ワークフローに統合するため。
- ドメインエキスパート: コードを書かずにエージェントをテストし、正確性や挙動に関する定性的なフィードバックを提供するため。
- プロダクトマネージャー: 要件を定義し、散在するフィードバックを測定可能なテストとメトリクスに変換するため。
主な特徴
- 統合されたフィードバックループ: ライブエージェントの対話と構造化されたレビュー、自動評価をつなぐ。
- 柔軟な接続性: SDKベースのWebSocket接続(パブリックURL不要)とRESTエンドポイントの両方をサポート。
- 自動テスト生成: 要件、PRD、またはNotion、GitHub、Jiraなどの接続ツールからテストを生成。
- 包括的な評価: 60以上のメトリクス(DeepEval、garak)とLLM-as-Judge評価者を含む。
- 開発者ツールキット: CursorなどのAI搭載IDEとの直接統合を可能にするMCPスキルを提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト