evidentlyai/evidently
Evidently is an open-source ML and LLM observability framework. Evaluate, test, and monitor any AI-powered system or data pipeline. From tabular data to Gen AI. 100+ metrics.
What it solves
Evidently 提供一個統一的框架來評估、測試與監控機器學習 (ML) 與大型語言模型 (LLM) 系統的品質。它解決了從實驗階段到正式上線期間,維持效能與可靠性的挑戰,特別針對資料漂移、模型退化以及生成式 AI 輸出品質等問題。
How it works
此函式庫透過三個主要元件運作:
- Reports:計算並彙總使用內建或自訂指標的品質評估。可用於探索性分析與除錯,並能匯出為 JSON、HTML 或 Python 字典。
- Test Suites:在 Reports 上加入通過/失敗條件,使用者即可建立自動化測試,用於回歸測試、CI/CD 檢查與資料驗證。
- Monitoring Dashboard:提供 UI 服務(可自行部署或使用受管雲端版),將這些指標與測試結果隨時間視覺化,以追蹤系統健康狀態。
Who it’s for
此工具設計給 ML 工程師、資料科學家與 AI 開發者,讓他們確保預測模型(分類、回歸)或生成系統(RAG、LLM 應用)在長時間內保持準確與穩定。
Highlights
- Broad Support:支援表格資料與文字資料。
- Extensive Metric Library:內建超過 100 種指標,涵蓋資料漂移、LLM‑as‑a‑judge 與傳統 ML 效能。
- Versatile Evaluation:支援預測任務(accuracy、precision)與生成任務(語意相似度、檢索相關性)。
- Flexible Deployment:提供離線實驗評估與線上即時監控兩種部署方式。