rhesis-ai/rhesis
Get the knowledge you need to develop your agents. The collaboration layer for AI teams: domain experts annotate and review agent behavior, engineers improve the agent from what they find.
What it solves
Rhesis は、LLM とエージェントアプリケーションの検証を手動の一回限りの監査から、継続的でチームベースのプロセスへと移行させることを目的とした協働テストプラットフォームです。AI の出力が非決定的であるという課題に対し、自動テスト生成、対抗的レッドチーミング、幅広い指標を用いた構造化評価ツールを提供します。
How it works
このプラットフォームは Python SDK と協働 UI を通じて AI 開発ライフサイクルに統合されます。AI 駆動の合成機能を用いて、自然言語の要件からテストシナリオを生成し、ファイルや MCP 経由でコンテキストソースに接続してテストが知識を意識できるようにします。
実行時には、ユーザーアプリケーションへ永続的なアウトバウンド WebSocket 接続を確立し、公開 URL を必要とせずに Rhesis がリモートでテストをトリガーできるようにします。OpenTelemetry を利用して LLM 呼び出しとレイテンシをトレースし、LiteLLM を活用してテスト生成と評価の両方で 100 以上のモデルプロバイダーをサポートします。
Who it’s for
- Engineers:AI テストを CI/CD パイプラインに統合し、トレースを通じて失敗をデバッグしたい方。
- Product Managers and Domain Experts:コードを書かずに行動要件を定義し、評価結果をレビューしたい方。
- Security Teams:継続的な対抗的テスト(レッドチーミング)で jailbreak や PII 漏洩を検出したい方。
Highlights
- AI-Powered Test Synthesis:シンプルな要件から数百のエッジケースと対抗的プロンプトを生成。
- Adversarial Agents:レッドチーミング用の Polyphemus エージェントと、脆弱性スキャン用の Garak 統合を搭載。
- Conversation Simulation:Penelope エージェントが現実的なマルチターン対話をシミュレートし、コンテキスト保持と一貫性をテスト。
- Extensive Metrics:RAGAS や DeepEval などのフレームワークから 60 以上の事前構築メトリクスを提供し、LLM-as-Judge で推論。
- Deep Observability:OpenTelemetry ベースのトレースで LangChain、LangGraph など主要エージェントフレームワークをサポート。