braintrustdata/autoevals

AutoEvals is a tool for quickly and easily evaluating AI model outputs using best practices.

解决的问题

Autoevals 提供了一个统一的接口来评估 AI 模型输出,无需手动实现常见的评估指标。它简化了分数归一化(在 0 到 1 之间缩放)和解析模型评分输出的过程,这些在实际应用中往往难以调试和调整。

工作原理

该库整合了多种评估方法,接收输入、输出和期望值,生成一个评分:

  • LLM-as-a-judge:使用模型对事实性、安全性、摘要等主观任务进行评分。
  • RAG 评估:专用于检索增强生成(RAG)的指标,如上下文精确度、召回率和忠实度。
  • 启发式与统计方法:传统的指标,如 Levenshtein 距离、BLEU 和精确匹配。
  • 自定义评分器:用户可以定义自己的基于 LLM 的分类器(使用自定义提示)或编写非 LLM 的评分函数。

支持通过 OpenAI 兼容 API 或 Braintrust Gateway 与多个 AI 提供商集成,实现缓存和可观测性。

适用人群

需要定量衡量模型性能并迭代优化提示或 RAG 流水线的 AI 应用开发者。

主要亮点

  • 多语言支持:支持 Python 和 TypeScript。
  • 统一接口:为不同评估方法提供单一一致的 API。
  • 可扩展性:轻松创建自定义模型评分评估或简单的启发式评分器。
  • 丰富的指标套件:包含大量预构建的评分器,适用于 RAG、通用 LLM 任务和嵌入相似度。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目