evidentlyai/evidently
Evidently is an open-source ML and LLM observability framework. Evaluate, test, and monitor any AI-powered system or data pipeline. From tabular data to Gen AI. 100+ metrics.
What it solves
Evidently 提供一个统一的框架来评估、测试和监控机器学习 (ML) 与大型语言模型 (LLM) 系统的质量。它解决了从实验阶段到生产阶段保持性能和可靠性的挑战,特别针对数据漂移、模型退化以及生成式 AI 输出质量等问题。
How it works
库通过三个主要组件运作:
- Reports:计算并汇总使用内置或自定义指标的质量评估。用于探索性分析和调试,可导出为 JSON、HTML 或 Python 字典。
- Test Suites:在 Reports 上添加通过/失败条件,用户可以创建自动化测试,用于回归测试、CI/CD 检查和数据验证。
- Monitoring Dashboard:提供 UI 服务(可自行托管或使用托管云版本),将这些指标和测试结果随时间可视化,以跟踪系统健康状态。
Who it’s for
它面向 ML 工程师、数据科学家和 AI 开发者,帮助他们确保预测模型(分类、回归)或生成系统(RAG、LLM 应用)长期保持准确和稳定。
Highlights
- Broad Support:支持表格数据和文本数据。
- Extensive Metric Library:内置超过 100 种指标,覆盖数据漂移、LLM‑as‑a‑judge 与传统 ML 性能。
- Versatile Evaluation:支持预测任务(accuracy、precision)和生成任务(语义相似度、检索相关性)。
- Flexible Deployment:提供离线实验评估和线上实时监控两种部署方式。