evidentlyai/evidently

Evidently is ​​an open-source ML and LLM observability framework. Evaluate, test, and monitor any AI-powered system or data pipeline. From tabular data to Gen AI. 100+ metrics.

What it solves

Evidently 提供一个统一的框架来评估、测试和监控机器学习 (ML) 与大型语言模型 (LLM) 系统的质量。它解决了从实验阶段到生产阶段保持性能和可靠性的挑战,特别针对数据漂移、模型退化以及生成式 AI 输出质量等问题。

How it works

库通过三个主要组件运作:

  1. Reports:计算并汇总使用内置或自定义指标的质量评估。用于探索性分析和调试,可导出为 JSON、HTML 或 Python 字典。
  2. Test Suites:在 Reports 上添加通过/失败条件,用户可以创建自动化测试,用于回归测试、CI/CD 检查和数据验证。
  3. Monitoring Dashboard:提供 UI 服务(可自行托管或使用托管云版本),将这些指标和测试结果随时间可视化,以跟踪系统健康状态。

Who it’s for

它面向 ML 工程师、数据科学家和 AI 开发者,帮助他们确保预测模型(分类、回归)或生成系统(RAG、LLM 应用)长期保持准确和稳定。

Highlights

  • Broad Support:支持表格数据和文本数据。
  • Extensive Metric Library:内置超过 100 种指标,覆盖数据漂移、LLM‑as‑a‑judge 与传统 ML 性能。
  • Versatile Evaluation:支持预测任务(accuracy、precision)和生成任务(语义相似度、检索相关性)。
  • Flexible Deployment:提供离线实验评估和线上实时监控两种部署方式。