evidentlyai/evidently

Evidently is ​​an open-source ML and LLM observability framework. Evaluate, test, and monitor any AI-powered system or data pipeline. From tabular data to Gen AI. 100+ metrics.

What it solves

Evidently は、機械学習 (ML) と大規模言語モデル (LLM) システムの品質を評価・テスト・モニタリングするための統一フレームワークを提供します。実験段階から本番運用まで性能と信頼性を維持する課題に対処し、特にデータドリフト、モデル劣化、生成 AI の出力品質といった問題を対象としています。

How it works

ライブラリは主に 3 つのコンポーネントで構成されています:

  1. Reports:組み込みまたはカスタム指標を用いて品質評価を計算・要約します。探索的分析やデバッグに利用でき、JSON、HTML、または Python 辞書としてエクスポート可能です。
  2. Test Suites:Reports に合格/不合格条件を付加し、回帰テスト、CI/CD チェック、データ検証の自動テストを作成できます。
  3. Monitoring Dashboard:UI サービス(セルフホストまたはマネージドクラウド版)で、これらの指標とテスト結果を時間経過とともに可視化し、システムの健康状態を追跡します。

Who it’s for

ML エンジニア、データサイエンティスト、AI 開発者向けに設計されており、予測モデル(分類・回帰)や生成システム(RAG、LLM アプリケーション)の精度と安定性を長期にわたって確保したい方に最適です。

Highlights

  • Broad Support:表形式データとテキストデータの両方に対応。
  • Extensive Metric Library:データドリフト、LLM‑as‑a‑judge、従来の ML パフォーマンスをカバーする 100 以上の組み込み指標を提供。
  • Versatile Evaluation:予測タスク(accuracy、precision)と生成タスク(セマンティック類似度、検索関連性)をサポート。
  • Flexible Deployment:実験用のオフライン評価と本番システム向けのライブモニタリング、両方のデプロイが可能です。