braintrustdata/autoevals

AutoEvals is a tool for quickly and easily evaluating AI model outputs using best practices.

解決的問題

Autoevals 提供一個統一的介面來評估 AI 模型輸出,無需手動實作常見的評估指標。它簡化了分數歸一化(在 0 到 1 之間縮放)和解析模型評分輸出的過程,這些在實際應用中往往難以除錯與調整。

工作原理

該套件整合了多種評估方法,接收輸入、輸出和期望值,產生一個分數:

  • LLM-as-a-judge:使用模型對事實性、安全性、摘要等主觀任務進行評分。
  • RAG 評估:專用於檢索增強生成(RAG)的指標,如上下文精確度、召回率和忠實度。
  • 啟發式與統計方法:傳統指標,如 Levenshtein 距離、BLEU 和精確匹配。
  • 自訂評分器:使用者可定義自己的基於 LLM 的分類器(使用自訂提示)或撰寫非 LLM 的評分函數。

支援透過 OpenAI 相容 API 或 Braintrust Gateway 與多個 AI 提供商整合,實現快取與可觀測性。

適用對象

需要定量衡量模型效能並迭代優化提示或 RAG 流水線的 AI 應用開發者。

主要亮點

  • 多語言支援:支援 Python 與 TypeScript。
  • 統一介面:為不同評估方法提供單一一致的 API。
  • 可擴展性:輕鬆建立自訂模型評分評估或簡單的啟發式評分器。
  • 豐富的指標套件:包含大量預建的評分器,適用於 RAG、通用 LLM 任務與嵌入相似度。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案