evidentlyai/evidently

Evidently is ​​an open-source ML and LLM observability framework. Evaluate, test, and monitor any AI-powered system or data pipeline. From tabular data to Gen AI. 100+ metrics.

What it solves

Evidently 提供一個統一的框架來評估、測試與監控機器學習 (ML) 與大型語言模型 (LLM) 系統的品質。它解決了從實驗階段到正式上線期間,維持效能與可靠性的挑戰,特別針對資料漂移、模型退化以及生成式 AI 輸出品質等問題。

How it works

此函式庫透過三個主要元件運作:

  1. Reports:計算並彙總使用內建或自訂指標的品質評估。可用於探索性分析與除錯,並能匯出為 JSON、HTML 或 Python 字典。
  2. Test Suites:在 Reports 上加入通過/失敗條件,使用者即可建立自動化測試,用於回歸測試、CI/CD 檢查與資料驗證。
  3. Monitoring Dashboard:提供 UI 服務(可自行部署或使用受管雲端版),將這些指標與測試結果隨時間視覺化,以追蹤系統健康狀態。

Who it’s for

此工具設計給 ML 工程師、資料科學家與 AI 開發者,讓他們確保預測模型(分類、回歸)或生成系統(RAG、LLM 應用)在長時間內保持準確與穩定。

Highlights

  • Broad Support:支援表格資料與文字資料。
  • Extensive Metric Library:內建超過 100 種指標,涵蓋資料漂移、LLM‑as‑a‑judge 與傳統 ML 效能。
  • Versatile Evaluation:支援預測任務(accuracy、precision)與生成任務(語意相似度、檢索相關性)。
  • Flexible Deployment:提供離線實驗評估與線上即時監控兩種部署方式。